

从 Facebook 公开主页抓取帖子并输出结构化数据,包括帖子正文、发布时间、反应数、评论数、分享数、作者信息、媒体附件等。无需 Facebook 登录或 API 令牌。
Facebook Posts Scraper 自动从 Facebook 公开主页抓取帖子并输出结构化数据——正文、时间戳、互动指标、作者信息、媒体附件等一应俱全。无需 Facebook 登录,也不需要 API 令牌,填入一个或多个公开主页 URL 即可开始抓取。
📝 帖子正文(text) | #️⃣ 从正文中提取的话题标签、@提及 和外部链接(textReferences) |
🕒 发布时间,ISO8601 格式(time)和 Unix 时间戳(timestamp) | 🔗 帖子直链(url)和来源主页 URL(facebookUrl) |
👤 作者 ID、名称、主页链接、头像(userId、userName、userProfileUrl、userProfilePic) | 👥 共同作者(collaborators) |
👍 总反应数(likes) | ❤️ 反应细分:Like、Love、Care、Haha、Wow(reactionLikeCount 等) |
💬 评论数(comments) | 🔁 分享数(shares) |
🖼️ 媒体附件——图片/视频的 URL、缩略图、尺寸、类型(media) | 🔗 帖子中的主要外部链接(link) |
👁️ 视频播放数(如可用,viewsCount) | 📋 原始输入 URL,用于数据溯源(inputUrl) |
startUrls一个或多个 Facebook 公开主页 URL。每个 URL 应指向一个可公开访问的 Facebook 主页(品牌、创作者、公众人物等)。抓取器会在无头浏览器中打开每个 URL,自动关闭登录弹窗,拦截 GraphQL 响应,并在需要时回退到 DOM 解析。
支持的 URL 格式:
https://www.facebook.com/humansofnewyork/https://www.facebook.com/nasahttps://www.facebook.com/Meta/不支持: 私密个人主页、封闭小组、活动页面或个人时间线——本抓取器专为公开主页的时间线设计。
startUrls 接受 JSON 数组。每个元素可以是纯 URL 字符串,也可以是包含 url 字段的对象。
示例——单个 URL:
示例——多个 URL:
resultsLimit每个入口 URL 最多抓取的帖子数量。设为 0 表示不限制(抓取器会持续滚动直到没有新帖子)。默认值为 20。
| 值 | 行为 |
|---|---|
0 | 不限制——抓取主页上所有能找到的帖子 |
20 | 收集 20 条帖子后停止(默认) |
100 | 收集 100 条帖子后停止 |
captionText开启后,抓取器会尝试提取视频帖子的字幕/转写文本。这是一个尽力而为的功能——字幕是否可用取决于 Facebook 的 GraphQL 响应中是否包含该视频的字幕数据。默认为 false。
提示: 大多数公开视频帖子的 GraphQL 响应中不包含转写数据。仅在你确实需要视频文本内容时开启此选项,并做好多数视频可能没有转写数据的心理准备。
使用以下两个参数按发布时间筛选帖子。可以单独使用,也可以组合使用来定义一个具体的时间窗口。
onlyPostsNewerThan只保留发布时间 ≥ 此值 的帖子。早于此时间的帖子会被跳过。支持以下格式:
| 格式 | 示例 |
|---|---|
| 日期(YYYY-MM-DD) | 2025-01-15 |
| ISO 8601 日期时间 | 2025-01-15T00:00:00Z |
| 相对时间(英文) | 3 months、2 weeks、1 day、6 hours |
| 相对时间(中文) | 3个月、2周、1天、6小时 |
| Unix 时间戳(秒) | 1736899200 |
相对时间从当前时间起算。例如 3个月 表示"从 3 个月前到现在"。
onlyPostsOlderThan只保留发布时间 ≤ 此值 的帖子。晚于此时间的帖子会被跳过。支持与 onlyPostsNewerThan 相同的格式。
示例——抓取特定日期范围的帖子:
示例——只抓取近期帖子:
每次成功运行后,结果数据会显示在输出面板中。默认以表格视图展示,带有分类标签方便分组浏览。你也可以一键切换到 JSON 视图。
导出时支持 CSV、JSON、JSONL、XLS、XLSX、HTML、XML 或 RSS 格式。导出前可以选择或取消选择特定字段,也可以下载包含所有字段的完整视图。
当抓取器处理一条帖子时,会返回一条完整的记录。以下是一条代表性示例,展示了完整的输出结构:
| 字段 | 类型 | 说明 |
|---|---|---|
facebookUrl | string | 来源主页 URL(即输入的主页 URL) |
postId | string | 帖子唯一 ID,来自 GraphQL 响应 |
pageName | string | 主页/账号显示名 |
url | string | 帖子直链(permalink) |
time | string | 发布时间,ISO8601 格式 |
timestamp | number | 发布时间,Unix 秒 |
text | string | 帖子正文;无正文时为空字符串 |
textReferences | array | 从正文中提取的话题标签、@提及和外部链接 |
likes | integer | 总反应数 |
comments | integer | 评论数 |
shares | integer | 分享数 |
media | array | 图/视频列表,每项含 url、thumbnail、width、height、type |
userId | string | 作者 profile ID |
userName | string | 作者显示名 |
userProfileUrl | string | 作者主页链接 |
userProfilePic | string | 作者头像 URL |
user | object | 作者嵌套备份对象 {id, name, profileUrl, profilePic} |
link | string | 帖子中的主要外部链接 |
reactionLikeCount | integer | Like 反应细分 |
reactionLoveCount | integer | Love 反应细分 |
reactionCareCount | integer | Care 反应细分 |
reactionHahaCount | integer | Haha 反应细分 |
reactionWowCount | integer | Wow 反应细分 |
viewsCount | integer | 视频播放数(如可用) |
collaborators | array | 共同作者 |
inputUrl | string | 原始输入 URL(溯源) |
注意: 并非所有字段在每条帖子中都有值。
viewsCount、collaborators、link等字段是尽力而为的,当 GraphQL 响应中没有对应数据时可能为null。反应细分字段(reactionLikeCount等)也是尽力而为的;likes(总反应数)通常更可靠地被填充。
抓取器连接到无头浏览器(Camoufox 或 Chrome WebSocket),打开你提供的每个 Facebook 主页 URL,自动关闭出现的登录弹窗——Facebook 的登录提示是可以关闭的弹窗,不是认证墙,关闭后公开主页的内容会正常加载。
主页加载完成后,抓取器实时拦截 Facebook 内部 GraphQL API 的响应来提取结构化的帖子数据。然后它会向下滚动页面以触发更多 GraphQL 请求、加载更多帖子。如果 GraphQL 拦截没有获取到结果(比如 Facebook 内部响应格式发生了变化),抓取器会自动回退到解析页面 DOM 中嵌入的 JSON 数据。
整个过程不需要 Facebook 账号、登录凭证或 API 令牌。
不需要。抓取器完全无需登录即可工作。它会自动关闭 Facebook 的登录弹窗,这足以访问公开主页内容。
可以抓取任何可公开访问的 Facebook 主页,包括品牌主页、创作者主页、公众人物主页和组织主页。关键要求是该主页必须可以公开浏览,无需登录。
私密个人主页、封闭小组、个人时间线和活动页面不在本抓取器的支持范围内。
没有硬性上限。resultsLimit 参数控制每次运行收集的帖子数量。设为 0 即为不限制——抓取器会持续滚动直到没有新帖子或达到内部滚动上限。对于大多数公开主页,单次运行可以收集几百到几千条帖子。
速度取决于你要抓取的帖子数量、主页的加载速度和网络条件。收集单个主页 50-100 条帖子的典型运行通常几分钟内完成。抓取多个主页时是顺序执行的,总时间与 URL 数量成正比。
当你打开一个 Facebook 主页时,浏览器会向 Facebook 内部的 GraphQL 端点发起 API 调用来加载帖子数据。抓取器实时监听这些 API 响应,直接从中提取结构化的 JSON 数据。这比解析渲染后的 HTML 更可靠,因为数据直接来自 Facebook 的数据层。
如果没有拦截到 GraphQL 响应(这可能在 Facebook 更改其内部 API 结构时发生),抓取器会自动回退到 DOM 解析。它读取页面的 HTML,从 script 标签中提取嵌入的 JSON 数据块,然后解析其中的帖子数据。这种回退方式是尽力而为的,但能确保即使 Facebook 前端发生变化,抓取器仍能保持功能。
Facebook 在未认证用户访问主页时会显示登录弹窗。这个弹窗不是认证墙——它是一个可关闭的对话框。抓取器点击关闭按钮(或按 Escape 键),通过 JavaScript 移除剩余的对话框遮罩层,并解锁页面滚动。这样主页内容就能正常加载,无需任何凭证。
抓取器对每个主页 URL 最多滚动 30 次。如果连续 3 次滚动都没有发现新帖子,抓取器会停止该 URL 的滚动。这既避免了在帖子较少的主页上无限滚动,又能最大化活跃主页的数据采集量。
可以。使用 onlyPostsNewerThan 和 onlyPostsOlderThan 参数来定义时间窗口。抓取器会按发布时间戳过滤帖子,并在遇到超出窗口范围的帖子时提前停止滚动,同时提升效率。
支持 8 种格式下载结果:CSV、JSON、JSONL、XLS、XLSX、HTML、XML 和 RSS。选择适合你工作流的格式——CSV 或 XLSX 用于电子表格,JSON/JSONL 用于程序化处理,XML/RSS 用于订阅源,HTML 用于快速浏览。
可以。你可以使用 CoreClaw REST API 以编程方式运行此抓取器。基础 URL 为 https://openapi.coreclaw.com,每个端点路径以 /api/v2 开头。使用 Authorization: Bearer YOUR_API_KEY 进行认证。
典型的 API 工作流:
GET /api/v2/workers/{workerId}/input-schema 获取 Worker 的输入参数定义。POST /api/v2/workers/{workerId}/runs 启动运行,在 input.parameters.custom 中传入参数。data.run_slug。GET /api/v2/worker-runs/{runId} 检查运行状态。GET /api/v2/worker-runs/{runId}/result 获取结果,或 GET /api/v2/worker-runs/{runId}/result/export 导出文件。详情请参阅 CoreClaw API 文档。
可以。你可以使用 CoreClaw REST API 或 MCP 服务器与 Make、Zapier、n8n 等自动化工具集成,也可以接入你自己的工作流。使用 webhook 在抓取运行完成后触发下游操作。
不需要。此抓取器包含在你的 CoreClaw 套餐中。有关套餐限制和价格的详情,请参阅 CoreClaw 价格页面。
在许多司法管辖区,抓取公开可用数据通常是允许的,但合法性取决于具体数据、你的司法管辖区、你的目的以及你如何处理个人信息。此抓取器仅在未经认证的情况下访问公开可见的主页内容。请始终尊重个人数据和知识产权规则,仅在有正当理由时进行抓取,并查阅 Facebook 的服务条款以了解你的使用场景是否合规。
我们一直在持续改进此抓取器的性能和覆盖范围。如果你发现了 bug 或注意到缺失字段,请提供你使用的输入设置、大致运行时间和一小段输出样本。你可以通过网站在线客服或发送邮件至 support@coreclaw.com 联系我们,以便我们复现问题并修复。
探索商店中更多热门采集工具
by CoreClaw
通过URL实时提取数据,轻松抓取帖子、分享和互动指标,免去复杂的基础设施维护与 IP 封禁烦恼,支持一键导出 CSV 或 JSON 格式。
by CoreClaw
通过输入个人资料 URL,批量提取公开的 Facebook 个人资料数据,包括用户基本信息、工作经历、教育背景、联系方式等,输出 CSV 或 JSON 格式。支持人才招聘筛选、身份验证和用户画像构建,零代码操作,一键导出结构化数据。
by CoreClaw
通过活动列表URLs批量提取 Facebook 公开活动数据,包含基本信息、主办方及参与人数,一键导出 CSV/JSON,无需代码操作。
by CoreClaw
通过链接批量提取 Facebook 公开活动数据,包含活动详情、参与人数与主办方信息,一键导出 CSV/JSON,无需代码操作。