Skip to content
信息工作流本地运行可使用

Folo / RSS 情报工作流

增量采集订阅内容,用 Codex 翻译英文正文,保留原文与来源,整理成分类阅读稿和结构化数据。

订阅采集与中文归档工作流中文阅读稿 · JSONL · 原文归档
流程示意
订阅信息,沉淀成中文归档
Folo 订阅当前使用 · AI / 金融
RSS / RSSHub按需配置订阅地址
  1. 去重
  2. 补全
  3. 翻译
  4. 归档
JSONL结构化数据Markdown中文阅读稿

保留原文与来源 · 可定时采集

它解决什么问题

订阅信息分散、英文阅读成本高,反复整理容易重复。把采集、翻译与归档串起来,让阅读稿保留来源,后续分析有据可查。

适合谁使用

持续关注 AI、金融等订阅内容,希望积累中文阅读材料与可供后续分析的数据的人。

它如何工作

配置订阅

选择 Folo 分类、每轮条数与翻译设置,也可按需添加 RSS 订阅地址。当前配置使用 Folo 的 AI、金融两类,RSS / RSSHub 地址尚未配置。

输入
Folo 分类或 RSS / RSSHub 订阅地址
产出
待采集的信息源配置

使用方式 ​

这是一套在本地运行的信息采集与中文归档工作流。先选择订阅分类或 RSS 地址,再采集正文、处理翻译,输出可阅读的 Markdown 和供后续程序处理的 JSONL。

首次使用需要 Python 3.9+、Node.js / npm、Folo CLI 和 Codex CLI,并完成 Folo 与 Codex 登录。在 config/sources.yaml 中设置来源、采集条数和翻译选项,准备好环境后,可以从项目目录执行单次采集:

bash
.venv/bin/python scripts/run_once.py

当前配置使用 Folo 的 AI、金融两类订阅,每类每轮读取最新 100 条。RSS / RSSHub 的解析与采集入口已实现,需要添加真实订阅地址后使用;当前地址列表为空。

采集与中文翻译 ​

Folo 条目先按 ID 与原文链接筛出未归档内容,再补充详情。详情最多四路并发,返回顺序保持一致;获取失败时使用时间线中已有的内容,因此正文完整程度取决于来源能提供的信息。

正文清洗保留链接和图片引用,同时整理作者、发布时间、来源与分类。英文正文通过本机 Codex CLI 分批翻译,长正文拆分处理,返回结果按条目校验后再写入。默认含中文字符的正文直接保留,原文与中文分别保存,阅读内容优先使用中文。

某个源采集或翻译失败时,其他源可以继续归档,整轮执行会以失败退出码结束,并记录成功与失败源数量。翻译没有完成的源不会被记为成功。

可以带走什么 ​

归档按 UTC 采集日期组织,输出三类产物:

产物内容与用途
原始响应保存采集返回的数据供排查,当前同轮仅保留最后写入的来源响应
JSONL每行一个条目,包含正文、原文、中文、来源链接与元数据,便于后续分析
分类 Markdown按日期与分类整理中文阅读稿,保留来源信息和不同于中文的原文

另有去重状态、运行日志,以及记录完成时间、成功或失败源数量和新增条数的最近运行状态。重复采集不会重复写入已有条目。

定时运行与历史回填 ​

可以手动执行,也可以安装 macOS launchd 任务,每 300 秒触发一次。安装器把后台代码、配置、Python 环境和固定版本的 Folo CLI 放到内置盘,归档数据由原项目与后台任务共用,减少后台运行对外接盘的依赖。

采集、手动执行和回填共用文件锁;一轮没有结束时,新的采集会跳过,避免同时写归档。定时运行需要有效的用户会话、网络和 Folo / Codex 登录。源码或来源配置更新后,需要重新安装任务以同步后台副本。

历史回填可指定日期、分类和条数,补充已有归档的 Folo 正文详情或中文翻译。这是对已有条目的补全;常规采集只读取最新一页,保存的游标用于排查。

当前范围 ​

当前重点是「订阅内容 → 中文阅读稿与结构化归档」。项目的本机验收记录覆盖 Folo 两类真实采集、Codex 翻译、重复执行去重与后台定时运行;RSS 解析和归档有测试覆盖,真实 RSS / RSSHub 订阅仍待配置。

当前同轮多源采集共用原始响应文件名,后写入的响应会覆盖先写入的响应,逐源回溯仍需完善。JSONL 中各条正文、原文、中文和来源链接会分别保留。

目前归档供阅读与后续分析使用,尚未自动生成情报摘要、发送通知或发布到博客。这个页面展示工作流本身,后续可以在归档之上继续设计选题、研究或内容生产流程。

技术实现:Python + YAML 配置,Folo CLI、Codex CLI、RSS / Atom 解析、JSONL / Markdown 归档与 macOS launchd。