

通过输入 URL,提取公开的 Instagram 个人资料数据。包括用户名、ID、简介、工作地点、网站 URL、粉丝数以及评论数等,并支持数据导出、API 调用或与第三方工具集成。
输入一组公开的 Instagram 主页链接,一次获取结构化的账号资料——用户名、显示名称、简介、粉丝数、商业分类、Bio 外链、近期帖子、关联账号等。无需登录,无需逐个主页手动翻看。
这个 worker 每个主页返回一条记录,可用于搭建创作者库、补全 CRM、或批量审计一组账号。每条记录还附带该主页的近期帖子(文案、标签、点赞、评论、媒体链接)以及 Instagram 在主页旁展示的关联账号。
related_profiles 字段获取 Instagram 为每个目标关联的账号,用于扩展或相似账号挖掘。| 👤 账号身份(用户名、显示名称、Instagram 与 Facebook ID) | 🔗 标准主页链接 |
| 🖼️ 头像(标准与高清) | ✅ 认证状态 |
| 🔒 私密账号标记 | 🏢 商业与专业账号标记 |
| 📝 简介文案 | #️⃣ 从简介中解析的标签 |
| 🔗 Bio 外链(标题、目标 URL、跳转 URL、链接类型) | 📧 从简介中解析的邮箱 |
| 👥 粉丝与关注数 | 📊 帖子总数 |
| 🏷️ 商业分类与主页分类 | 📍 商业地址 |
| 📰 近期帖子(文案、标签、点赞、评论、媒体链接) | 🖼️ 帖子媒体(展示图、视频链接、尺寸) |
| 🎞️ 轮播子项(逐项图片/视频、短码、尺寸) | 📌 置顶帖标记 |
| 💬 评论关闭标记 | 🕒 帖子发布时间(UTC ISO 8601) |
| ✨ 快拍精选数量 | 🎬 IGTV 视频数 |
| 👥 关联账号(用户名、名称、头像、认证、隐私状态) | 📢 近期帖子聚合的标签 |
| 🆕 近期加入标记 | 📡 广播频道标记 |
除字段本身外,worker 还提供这些能力:
worker 接收一组公开 Instagram 主页链接。profile_url 字段是行数组,每行包含一个 url 值。每行作为独立目标处理,重复主页会自动去重。
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
profile_url | 请求列表 | 是 | — | 一个或多个公开 Instagram 主页链接,每行是带 url 值的对象。 |
profile_url公开 Instagram 账号的主页链接。仅接受 instagram.com、www.instagram.com、m.instagram.com 下的 http:// 和 https:// 链接。单段主页路径(/nasa/)被接受,/reels/、/tagged/ 子页也被接受(会规范化到主页)。为兼容旧调用,纯用户名(nasa)也被接受。Instagram 保留路径(accounts、direct、explore、p、reel、stories、tv 等)被拒绝。单条帖子、Reel、标签页、探索页链接不是主页链接,会被拒绝。
✅ 推荐示例:
❌ 不支持(会被拒绝):
每个成功解析的公开主页输出一行,写入 CoreClaw 结果表。表格列覆盖上面列出的全部字段;Instagram 额外返回的字段会自动补进表里。
username 或 profile_url 识别每个账号。一条真实的主页记录,取自对 nasa 主页的实际采集。每个键都是真实的输出列,值是 Instagram 实际返回的字段(资源链接为便于阅读做了缩短;posts/latest_posts/related_profiles 数组做了精简以保持样例可读——实际运行时每个数组会返回更多条目)。
真实输出里有几点值得留意:posts 与 latest_posts 内容高度重叠——两者都承载主页的近期帖子,latest_posts 是规范化后的形态(不带 image_url、post_hashtags、location 等遗留字段)。实际运行约返回主页快照所暴露的最近 12 条帖子;需要更久历史,请用专门的帖子采集器。is_pinned 在 Instagram 未把帖子标为置顶时是空字符串(""),不是 false。location 在帖子无位置标签时为空对象({})。category_name 与 business_address 即便在商业主页上也常为空——只有 business_category_name 比较稳定。email_address 除非简介里能提取到邮箱,否则为空。external_urls 里个别条目的 title 或 lynx_url 可能为空——Instagram 不一定都提供。
id、fbid、account、username、profile_name、full_name、profile_url、profile_pic_url、profile_pic_url_hd。id 是 Instagram 用户 ID;fbid 是关联 Facebook 的 Instagram ID(可得时)。account 与 profile_name 分别是 username 和 full_name 的遗留别称。profile_pic_url_hd 是 Instagram 暴露时的高清头像。
followers、following、posts_count、is_private、is_verified、is_business_account、is_professional_account、is_joined_recently、has_channel。三个核心计数(followers、following、posts_count)是整数;其余是布尔标记。has_channel 表示主页是否有广播频道。
biography、bio_hashtags、external_urls、email_address、business_category_name、category_name、business_address。bio_hashtags 是从简介解析的不带 # 前缀的标签字符串数组。external_urls 是结构化数组——每条带 title、url(目标地址)、lynx_url(Instagram 的跳转包装)、link_type。email_address 是简介中找到的邮箱以竖线拼接的字符串,无邮箱时为空。
posts 与 latest_posts。两者都承载主页的近期帖子,每条是结构化对象:id、type(Image、Video 或 Sidecar)、short_code、caption、hashtags(不带 #)、mentions(不带 @)、url、comments_count、likes_count、timestamp(UTC ISO 8601)、dimensions_height/dimensions_width、display_url、images、child_posts(轮播子项)、product_type、is_pinned、is_comments_disabled、owner_id、alt_text、video_url。posts 数组每条还额外带 location 与 post_hashtags(带 #)。用 timestamp 按发布时间排序,用 type 筛选图片、视频、轮播。
highlights_count、highlight_reel_count、igtv_video_count、highlights、post_hashtags、related_profiles。highlight_reel_count 是精选快拍数量;highlights_count 是遗留别称。igtv_video_count 是 IGTV/Felix 视频数。post_hashtags 是近期帖子聚合后去重的标签集合。related_profiles 列出 Instagram 在主页旁展示的关联账号——每条带 id、full_name、is_private、is_verified、profile_pic_url、username。
input_url、source_type、detail_type。input_url 原样回显你提交的链接(当你传入 /reels/ 或 /tagged/ 子页时,可据此追溯某行来自哪个输入)。source_type 与 detail_type 恒为 profile。
传入一个或多个公开 Instagram 主页链接(每行一个)。worker 先校验并把每个链接规范化为标准主页链接,采集 Instagram 暴露的公开主页元数据,再把每个成功解析的主页作为一条结构化行写入 CoreClaw 结果表。无法加载的主页会记录在运行日志里,不会产出字段大量为空的结果行。
可以。profile_url 字段是数组,每行是独立目标,各有自己的 url。重复主页会自动去重。所有结果汇入同一张输出表,每条都带 input_url 和 username 标记。
标准主页链接(https://www.instagram.com/nasa/)、移动端变体(m.instagram.com)、/reels/ 与 /tagged/ 子页(规范化到主页),以及纯用户名(nasa)。单条帖子、Reel、标签页、地点页、探索页链接会被拒绝,accounts、direct、explore、p、reel、stories、tv 等保留路径也会被拒绝。
都返回。每条主页记录在 posts 与 latest_posts 数组里附带其近期帖子——文案、标签、提及、点赞、评论、媒体链接、轮播子项、发布时间。这些是 Instagram 在主页快照里暴露的帖子(约最近 12 条)。需要更久历史或更多帖子,请用专门的帖子采集器。
如果主页是私密、已删除或无法解析,worker 会记录失败并继续处理下一个主页,不会为该主页产出空数据行——只有成功解析的主页会出现在结果表里。同一次运行中其他主页不受影响。
Instagram 对匿名请求只公开部分主页字段。常为空的字段有 biography、category_name、business_address、email_address、highlight_reel_count——它们是否有值取决于主页公开了什么。布尔标记总会填,字符串与计数字段是尽力而为。
能。结果可导出为 8 种格式(CSV、JSON、JSONL、XLSX、XLS、XML、HTML、RSS),可通过 webhook 接收结果,可通过 MCP 驱动 worker,也可接入 n8n / Zapier 类自动化平台。
可以。通过 CoreClaw REST API 以编程方式运行 worker。
base URL 为 https://openapi.coreclaw.com,所有路径以 /api/v2 开头,鉴权用 Authorization: Bearer YOUR_API_KEY(legacy api-key header 与 ?token= query 仍兼容)。
典型流程:
GET /api/v2/workers/{workerId}/input-schema 取输入 schema(或 GET /api/v2/workers/{workerId} 取完整详情)。workerId 为 slug 或 owner~name 路径,version 缺省为 latest。POST /api/v2/workers/{workerId}/runs 启动运行,传 is_async,scraper 输入放在 input.parameters.custom。可设 callback_url 接收回调免轮询。data.run_slug。GET /api/v2/worker-runs/{runId} 查状态(用 run_slug 作 {runId})。读 data.status:ready/running 继续轮询,succeeded 取结果,failed 看 data.err_msg 与日志,aborting 表示已请求取消。以 status 为准,不要用结果行数或时间戳判断成败。GET /api/v2/worker-runs/{runId}/result 取结果(offset 为从 0 开始的行偏移,offset += limit 翻页;data.count 为总行数),或 /result/export 导出文件(8 种格式)。采集公开数据一般允许,但关键看怎么用。遵守 Instagram 的服务条款、尊重知识产权,不要以侵犯隐私或平台规则的方式再发布个人数据。以上为一般性说明,非法律意见——具体场景请咨询律师。
发现 bug、有功能建议,或想分享你的用法?联系 support@coreclaw.com——反馈能帮助持续改进这个 worker。