场景方案 / 学术研究
中文社交媒体研究的语料采集
新闻传播、社会学、公共政策研究——公众号是中文网络公共表达的重要场域。以可复现的方式采集、留存并结构化目标账号的文本语料。
你可能正面对
手工采集不可复现
论文方法论要求采集过程可描述、可重复,手动复制粘贴无法通过评审的追问。
样本随时间流失
文章删改导致语料缺失,纵向研究做到一半发现样本已经不完整。
格式清洗耗时
网页复制的文本格式混乱,进分析工具前的清洗占掉大量研究时间。
Mp2RSS 提供什么
采样框清晰可陈述
订阅清单即采集边界,方法论章节可以准确描述「采集了哪些账号、从何时起」。
时间戳完整可靠
每篇文章带原始发布时间(UTC 毫秒),纵向分析与时序建模的时间轴可靠。
结构化直接进管道
JSON 输出直接进 R / Python,正文为 Markdown 纯文本,分词与文本分析无需再清洗。
三步接入
1订阅内容源
贴入任意一篇公众号文章链接即可订阅整个号;X 账号按昵称搜索订阅。清单由你掌控,随时增删。
2系统持续采集
新文章自动抓取、清洗并结构化入库;已入库文章永久留存,随时回溯。
3拉取结构化数据
用 Open API(JSON + Bearer Key)或 RSS / Atom / JSON Feed,把数据接进你的系统。
每篇文章的结构化字段
文章入库后以统一结构交付,Open API 返回 JSON,Feed 输出 RSS / Atom / JSON Feed 三种格式:
title文章标题summary摘要contentMarkdown正文 Markdown(可自行渲染 HTML / 向量化)originalUrl原文永久链接coverImageUrl封面图publishedAt原始发布时间(UTC 毫秒时间戳)
Open API 示例
一个 Bearer Key 即可按公众号分页拉取文章(按发布时间倒序,每页最多 100 条):
curl "https://mp2rss.bugcode.dev/open-api/subscriptions/{mpId}/articles?page=1&pageSize=20" \
-H "Authorization: Bearer $FEED_KEY"能力边界:我们只做数据层
Mp2RSS 提供公众号等内容源文章的采集、清洗与结构化交付。情感分析、报告生成、可视化等加工由你的下游工具完成;正文按原文交付,不做内容二创、不篡改原意,并始终保留原文链接与来源归属。
常见问题
- 能采集到订阅之前的历史文章吗?
- 订阅生效后系统开始持续采集该账号的新文章并永久留存。建议在研究设计阶段尽早订阅目标账号,从订阅日起构建完整语料窗口。
- 引用与研究伦理如何处理?
- 每篇文章保留原文链接与来源账号归属,便于规范引用。语料使用请遵循所在机构的研究伦理规范与平台服务条款。
- 数据格式适合文本分析吗?
- 适合。正文为 Markdown 纯文本,配标题、摘要与时间戳字段,jieba / spaCy 等分词与 NLP 工具可直接消费。
把数据接进你的工作流
登录后订阅内容源,即可拿到你的 Feed 链接与 API Key。
Mp2RSS