

批量获取 Instagram 主页公开 Posts 和 Reels 数据,包括帖子内容、互动信息、媒体链接及作者信息,满足账号分析、内容研究和数据分析需求。
输入一组公开的 Instagram 主页链接,一次获取结构化的帖子数据——文案、标签、互动指标、媒体链接、创作者主页信息等。每个主页可单独选择采集帖子或 Reels,支持按 UTC 起始日期筛选,结果可导出为 8 种格式,无需手动翻页或逐条复制。
这个 worker 每条帖子(或 Reels)返回一条记录,并标注内容类型,适合一次搭建创作者库、对标竞品,或把数据推送到下游 BI 与自动化系统。
post_type,可选采集主页帖子或 Reels,通过 content_type 字段清晰区分两类内容。start_date,只保留该日期及之后发布的内容——适合做时间范围内的活动或报表快照。| 📝 帖子文案 | 🏷️ 标签 |
| ❤️ 点赞数 | 💬 评论数 |
| 📅 发布时间(Unix 时间戳) | 🔗 帖子链接 |
| 👤 创作者用户名、主页链接与 ID | 👥 被标记的用户 |
| 🖼️ 图片链接 | 🎞️ 视频链接 |
| 🎬 逐条媒体内容(轮播项、图片/视频链接、无障碍文案) | 🎵 音频元数据(艺术家、标题、静音状态) |
| ⏯️ 视频观看与播放数 | 🌐 位置名称 |
| 💬 最新预览评论 | 🔁 联合发布者 |
| 💼 付费合作标记与赞助商详情 | 🖼️ 创作者头像 |
| ✔️ 创作者认证状态与粉丝数 | 📊 创作者的帖子总数 |
📌 内容类型(Posts / Reels) | 🎞️ 缩略图 |
| 📝 无障碍文案(alt text) | 🖼️ 帖子中的图片数量 |
除字段本身外,worker 还提供这些能力:
content_type 标注,便于筛选。每个任务接收一个主页链接行及该行的选项。startURLs 字段是行数组,每行作为独立任务处理。
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
profile_url | URL | 是 | — | 公开的 Instagram 主页链接,如 https://www.instagram.com/nasa/。 |
post_type | String(枚举) | 是 | Posts | Posts 采集主页帖子,Reels 采集 Reels。 |
max_results | Integer | 是 | 10 | 该主页最多采集多少条帖子/Reels 记录。非正或无效值回退为 10。 |
start_date | String(日期) | 否 | "" | 只保留该 UTC 日期及之后发布的内容。推荐 YYYY-MM-DD 格式。 |
profile_url公开 Instagram 账号的主页链接。仅接受 instagram.com、www.instagram.com、m.instagram.com 下的 http:// 和 https:// 链接。单段主页路径(/nasa/)被接受,/reels/、/tagged/ 子页也被接受(会规范化到主页)。Instagram 保留路径(accounts、direct、explore、p、reel、stories、tv 等)被拒绝。单条帖子、Reel、标签页、探索页链接不是主页链接,会被拒绝。
✅ 推荐示例:
❌ 不支持(会被拒绝):
post_type选择从主页采集哪种内容类型。每行只能选一个值——不能在同一行混采帖子与 Reels,需用不同行分别设置。
Posts —— 主页帖子(图片、轮播)。默认。Reels —— 仅 Reels。max_results该主页返回的成功记录上限。这是每个主页的上限,不是全局上限——3 个主页各配 max_results: 10,最多能拿到 30 条记录。非正或非整数会回退为 10。
✅ 推荐示例:
start_date可选的 UTC 起始日期。设置后,只保留在该日历日起始时刻(UTC)及之后发布的内容。留空则从主页最新帖子向前采集。推荐 YYYY-MM-DD 格式,MM-DD-YYYY、DD/MM/YYYY、MM/DD/YYYY、YYYY/MM/DD 也被接受。
每行一条帖子或 Reel,写入 CoreClaw 结果表。表格列覆盖上面列出的全部字段;Instagram 额外返回的字段会自动补进表里。
content_type 把 Posts 和 Reels 分开看,用 profile_url 按来源主页分组。一条真实的帖子记录,取自对 nasa 主页的实际采集。每个键都是真实的输出列,值是 Instagram 实际返回的字段(资源链接为便于阅读做了缩短)。
真实输出里有几点值得留意:posts_count 即便 followers 有值也常为空字符串——Instagram 不一定在主页快照里返回帖子总数,应把它当作尽力而为的字段。has_handshake、engagement_score_view、video_view_count、video_play_count 在图片帖子里是空字符串,因为这些指标只对视频内容有意义;在 Reels 上它们带真实值。latest_comments 在主页预览评论不可用或被日期筛选过滤掉时为空数组。post_content 为轮播帖子的每个媒体项各承载一条(每条带 dimensions_height/dimensions_width),而 photos/videos 是扁平的链接数组,便于快速取用。
likes、num_comments、video_view_count、video_play_count——核心互动指标,可用来计算互动率(如 likes / followers)并对创作者的内容排序。engagement_score_view 是占位字段,除非已计算评分否则为空。
user_posted、user_posted_id、profile_url、profile_image_link、is_verified、followers、posts_count——创作者的账号级元数据。每条帖子行都附带一份快照,去重后即可得到单条主页记录。posts_count 即便 followers 有值也可能为空。
photos、videos、post_content、images、videos_duration、thumbnail、photos_number、product_type、content_type、audio。用 content_type 把 Posts 和 Reels 分开,用 post_content 看轮播帖子的完整逐条媒体明细(每条带 media_type、image_url/video_url、dimensions_height/dimensions_width、alt_text)。videos_duration 把每个视频链接与从其 DASH 清单中提取的时长配对。
description、hashtags、alt_text、tagged_users、coauthor_producers、location。hashtags 是从文案中解析的带 # 前缀字符串数组;tagged_users 是结构化对象(用户名、全名、是否认证、头像);coauthor_producers 在帖子为联合发布时列出联合发布者。
is_paid_partnership 与 partnership_details。当帖子被标记为付费合作时,partnership_details 带有结构化的赞助商记录(赞助商用户名、全名、头像、是否认证)。
date_posted 以 Unix 时间戳(UTC 秒)记录发布时间,可按发布时间排序帖子或梳理发布节奏。url 是可在浏览器打开、跳转到 Instagram 查看该帖子的链接。shortcode 与 pk 是 Instagram 对同一媒体内容的标识符。
传入一个或多个公开 Instagram 主页链接(每行一个)及每个主页的选项。worker 采集你为每个主页选定的内容类型,应用 UTC 起始日期筛选,再把每条帖子或 Reel 作为结构化行写入 CoreClaw 结果表。
能,但不能在同一行里混采。在 startURLs 里用不同行——一行 post_type: "Posts",另一行 post_type: "Reels"。两类结果落到同一张输出表里,事后可用 content_type 字段分开。
可以。startURLs 字段是数组,每行是独立任务,各有自己的 profile_url、post_type、max_results、start_date。所有结果汇入同一张输出表,并以来源 profile_url 和 user_posted 标记。
start_date 是一个 UTC 起始日期。设置后,只保留在该日历日起始时刻(UTC)及之后发布的内容。留空则从主页最新帖子向前采集。筛选针对的是 date_posted(帖子的发布时间戳)。注意:没有结束日期字段——筛选只看起始日期。
如果某个主页无法加载或没有匹配筛选条件的媒体,worker 会为该主页输出一条带 error 和 error_code 的终止行。同一次运行中其他主页的成功记录仍会正常返回。
调整 max_results 是最直接的手段——按需设置即可,每个主页采集越多越慢。把大批主页列表拆分到多次运行里,也能让平台并行处理。
能。结果可导出为 8 种格式(CSV、JSON、JSONL、XLSX、XLS、XML、HTML、RSS),可通过 webhook 接收结果,可通过 MCP 驱动 worker,也可接入 n8n / Zapier 类自动化平台。
可以。通过 CoreClaw REST API 以编程方式运行 worker。
base URL 为 https://openapi.coreclaw.com,所有路径以 /api/v2 开头,鉴权用 Authorization: Bearer YOUR_API_KEY(legacy api-key header 与 ?token= query 仍兼容)。
典型流程:
GET /api/v2/workers/{workerId}/input-schema 取输入 schema(或 GET /api/v2/workers/{workerId} 取完整详情)。workerId 为 slug 或 owner~name 路径,version 缺省为 latest。POST /api/v2/workers/{workerId}/runs 启动运行,传 is_async,scraper 输入放在 input.parameters.custom。可设 callback_url 接收回调免轮询。data.run_slug。GET /api/v2/worker-runs/{runId} 查状态(用 run_slug 作 {runId})。读 data.status:ready/running 继续轮询,succeeded 取结果,failed 看 data.err_msg 与日志,aborting 表示已请求取消。以 status 为准,不要用结果行数或时间戳判断成败。GET /api/v2/worker-runs/{runId}/result 取结果(offset 为从 0 开始的行偏移,offset += limit 翻页;data.count 为总行数),或 /result/export 导出文件(8 种格式)。采集公开数据一般允许,但关键看怎么用。遵守 Instagram 服务条款、尊重知识产权,不要以侵犯隐私或平台规则的方式再发布个人数据。以上为一般性说明,非法律意见——具体场景请咨询律师。
发现 bug、有功能建议,或想分享你的用法?联系 support@coreclaw.com——反馈能帮助持续改进这个 worker。
探索商店中更多热门采集工具
by CoreClaw
通过链接提取 Instagram 公开帖子数据,包含用户信息、互动数据与主页详情。一键导出 CSV/JSON,支持批量采集,无需代码操作。
by CoreClaw
Instagram 评论抓取工具 (by 帖子URL) 采集 Instagram 帖子和 Reels 的评论数据。你可以把这些评论数据用于情感分析、受众研究、内容审核和互动报告。
by CoreClaw
通过输入一个或多个Reel 链接,从公开的 Instagram Reels 中抓取创作者详情、标签、评论、互动数等数据,支持媒体归档与结构化数据输出。
by CoreClaw
采集 Instagram 公开个人主页数据,获取用户名、简介、粉丝数量、关注数量、网站链接及最新帖子数据,用于账号研究、竞品分析和社媒数据整理。