场景方案 / 学术研究

中文社交媒体研究的语料采集

新闻传播、社会学、公共政策研究——公众号是中文网络公共表达的重要场域。以可复现的方式采集、留存并结构化目标账号的文本语料。

你可能正面对

  • 手工采集不可复现

    论文方法论要求采集过程可描述、可重复,手动复制粘贴无法通过评审的追问。

  • 样本随时间流失

    文章删改导致语料缺失,纵向研究做到一半发现样本已经不完整。

  • 格式清洗耗时

    网页复制的文本格式混乱,进分析工具前的清洗占掉大量研究时间。

Mp2RSS 提供什么

  • 采样框清晰可陈述

    订阅清单即采集边界,方法论章节可以准确描述「采集了哪些账号、从何时起」。

  • 时间戳完整可靠

    每篇文章带原始发布时间(UTC 毫秒),纵向分析与时序建模的时间轴可靠。

  • 结构化直接进管道

    JSON 输出直接进 R / Python,正文为 Markdown 纯文本,分词与文本分析无需再清洗。

三步接入

  1. 1订阅内容源

    贴入任意一篇公众号文章链接即可订阅整个号;X 账号按昵称搜索订阅。清单由你掌控,随时增删。

  2. 2系统持续采集

    新文章自动抓取、清洗并结构化入库;已入库文章永久留存,随时回溯。

  3. 3拉取结构化数据

    用 Open API(JSON + Bearer Key)或 RSS / Atom / JSON Feed,把数据接进你的系统。

每篇文章的结构化字段

文章入库后以统一结构交付,Open API 返回 JSON,Feed 输出 RSS / Atom / JSON Feed 三种格式:

  • title文章标题
  • summary摘要
  • contentMarkdown正文 Markdown(可自行渲染 HTML / 向量化)
  • originalUrl原文永久链接
  • coverImageUrl封面图
  • publishedAt原始发布时间(UTC 毫秒时间戳)

Open API 示例

一个 Bearer Key 即可按公众号分页拉取文章(按发布时间倒序,每页最多 100 条):

curl "https://mp2rss.bugcode.dev/open-api/subscriptions/{mpId}/articles?page=1&pageSize=20" \
  -H "Authorization: Bearer $FEED_KEY"

能力边界:我们只做数据层

Mp2RSS 提供公众号等内容源文章的采集、清洗与结构化交付。情感分析、报告生成、可视化等加工由你的下游工具完成;正文按原文交付,不做内容二创、不篡改原意,并始终保留原文链接与来源归属。

常见问题

能采集到订阅之前的历史文章吗?
订阅生效后系统开始持续采集该账号的新文章并永久留存。建议在研究设计阶段尽早订阅目标账号,从订阅日起构建完整语料窗口。
引用与研究伦理如何处理?
每篇文章保留原文链接与来源账号归属,便于规范引用。语料使用请遵循所在机构的研究伦理规范与平台服务条款。
数据格式适合文本分析吗?
适合。正文为 Markdown 纯文本,配标题、摘要与时间戳字段,jieba / spaCy 等分词与 NLP 工具可直接消费。

把数据接进你的工作流

登录后订阅内容源,即可拿到你的 Feed 链接与 API Key。