场景方案 / AI 工作流
给 AI 工作流一个干净的中文内容数据源
RAG 知识库、Agent 情报采集、内容分析管道——公众号文章是高质量中文语料的重要来源。Mp2RSS 输出 Markdown 正文与结构化元数据,LLM 直接可用。
你可能正面对
爬虫方案脆弱
自建公众号爬虫对抗反爬、频繁失效,工程精力耗在数据获取而不是模型效果上。
HTML 噪音多
原始页面混杂导航、样式与推广,喂给模型前的清洗成本高、效果不稳。
知识库不新鲜
一次性导出的语料无法持续更新,RAG 回答停留在导出那天。
Mp2RSS 提供什么
Markdown 正文
正文以 Markdown 交付,天然适配 LLM 上下文窗口与向量化分块,无需再清洗 HTML。
元数据齐备
标题、摘要、发布时间、原文链接随文交付,RAG 引用溯源与时效过滤开箱即用。
增量同步
Open API 按发布时间倒序分页,定时任务增量拉取新文章、嵌入、入向量库,知识库始终新鲜。
三步接入
1订阅内容源
贴入任意一篇公众号文章链接即可订阅整个号;X 账号按昵称搜索订阅。清单由你掌控,随时增删。
2系统持续采集
新文章自动抓取、清洗并结构化入库;已入库文章永久留存,随时回溯。
3拉取结构化数据
用 Open API(JSON + Bearer Key)或 RSS / Atom / JSON Feed,把数据接进你的系统。
每篇文章的结构化字段
文章入库后以统一结构交付,Open API 返回 JSON,Feed 输出 RSS / Atom / JSON Feed 三种格式:
title文章标题summary摘要contentMarkdown正文 Markdown(可自行渲染 HTML / 向量化)originalUrl原文永久链接coverImageUrl封面图publishedAt原始发布时间(UTC 毫秒时间戳)
Open API 示例
一个 Bearer Key 即可按公众号分页拉取文章(按发布时间倒序,每页最多 100 条):
curl "https://mp2rss.bugcode.dev/open-api/subscriptions/{mpId}/articles?page=1&pageSize=20" \
-H "Authorization: Bearer $FEED_KEY"能力边界:我们只做数据层
Mp2RSS 提供公众号等内容源文章的采集、清洗与结构化交付。情感分析、报告生成、可视化等加工由你的下游工具完成;正文按原文交付,不做内容二创、不篡改原意,并始终保留原文链接与来源归属。
常见问题
- 怎么接进 LangChain / LlamaIndex 或 Coding Agent?
- 写一个简单的 loader:用 Bearer Key 调 Open API 拉 JSON,把 contentMarkdown 分块向量化即可。另有配套 CLI(mp2rss)与 Agent Skill 接入、站点提供 llms.txt 机器摘要——Claude Code / Cursor 等 Agent 可以直接代你订阅与拉取文章。
- 正文很长,会不会撑爆上下文?
- contentMarkdown 是全文,你可以按需分块或先用 summary 字段做低成本预筛,再对命中的文章取全文。
- 数据可以用于模型训练吗?
- Mp2RSS 只负责按原文结构化交付并保留来源归属;是否可用于训练取决于内容的著作权与平台条款,请自行评估合规后使用。
把数据接进你的工作流
登录后订阅内容源,即可拿到你的 Feed 链接与 API Key。
Mp2RSS