场景方案 / AI 工作流

给 AI 工作流一个干净的中文内容数据源

RAG 知识库、Agent 情报采集、内容分析管道——公众号文章是高质量中文语料的重要来源。Mp2RSS 输出 Markdown 正文与结构化元数据,LLM 直接可用。

你可能正面对

  • 爬虫方案脆弱

    自建公众号爬虫对抗反爬、频繁失效,工程精力耗在数据获取而不是模型效果上。

  • HTML 噪音多

    原始页面混杂导航、样式与推广,喂给模型前的清洗成本高、效果不稳。

  • 知识库不新鲜

    一次性导出的语料无法持续更新,RAG 回答停留在导出那天。

Mp2RSS 提供什么

  • Markdown 正文

    正文以 Markdown 交付,天然适配 LLM 上下文窗口与向量化分块,无需再清洗 HTML。

  • 元数据齐备

    标题、摘要、发布时间、原文链接随文交付,RAG 引用溯源与时效过滤开箱即用。

  • 增量同步

    Open API 按发布时间倒序分页,定时任务增量拉取新文章、嵌入、入向量库,知识库始终新鲜。

三步接入

  1. 1订阅内容源

    贴入任意一篇公众号文章链接即可订阅整个号;X 账号按昵称搜索订阅。清单由你掌控,随时增删。

  2. 2系统持续采集

    新文章自动抓取、清洗并结构化入库;已入库文章永久留存,随时回溯。

  3. 3拉取结构化数据

    用 Open API(JSON + Bearer Key)或 RSS / Atom / JSON Feed,把数据接进你的系统。

每篇文章的结构化字段

文章入库后以统一结构交付,Open API 返回 JSON,Feed 输出 RSS / Atom / JSON Feed 三种格式:

  • title文章标题
  • summary摘要
  • contentMarkdown正文 Markdown(可自行渲染 HTML / 向量化)
  • originalUrl原文永久链接
  • coverImageUrl封面图
  • publishedAt原始发布时间(UTC 毫秒时间戳)

Open API 示例

一个 Bearer Key 即可按公众号分页拉取文章(按发布时间倒序,每页最多 100 条):

curl "https://mp2rss.bugcode.dev/open-api/subscriptions/{mpId}/articles?page=1&pageSize=20" \
  -H "Authorization: Bearer $FEED_KEY"

能力边界:我们只做数据层

Mp2RSS 提供公众号等内容源文章的采集、清洗与结构化交付。情感分析、报告生成、可视化等加工由你的下游工具完成;正文按原文交付,不做内容二创、不篡改原意,并始终保留原文链接与来源归属。

常见问题

怎么接进 LangChain / LlamaIndex 或 Coding Agent?
写一个简单的 loader:用 Bearer Key 调 Open API 拉 JSON,把 contentMarkdown 分块向量化即可。另有配套 CLI(mp2rss)与 Agent Skill 接入、站点提供 llms.txt 机器摘要——Claude Code / Cursor 等 Agent 可以直接代你订阅与拉取文章。
正文很长,会不会撑爆上下文?
contentMarkdown 是全文,你可以按需分块或先用 summary 字段做低成本预筛,再对命中的文章取全文。
数据可以用于模型训练吗?
Mp2RSS 只负责按原文结构化交付并保留来源归属;是否可用于训练取决于内容的著作权与平台条款,请自行评估合规后使用。

把数据接进你的工作流

登录后订阅内容源,即可拿到你的 Feed 链接与 API Key。