

获取Thumbtack的评论及评论数据
CoreClaw Thumbtack业务爬虫
CoreClaw Worker,用于爬取公共Thumbtack业务/个人资料页面,并返回以下信息:
评论总数 — 例如,显示70条评论 → review_count = 70
入职次数 — 例如,显示Hired 34 times → hired_count = 34(当Thumbtack未显示时为null)
最新的5条标记为Hired on Thumbtack的评论 — 按时间倒序排列。忽略未标记的评论。如果符合条件的评论少于五条,则返回可用数量(这不是错误)。
输入
字段 标签 必填 描述
url Thumbtack业务URL 是 公共Thumbtack业务/个人资料URL(必须是thumbtack.com上的http/https URL)
示例:
{
"url": "https://www.thumbtack.com/ca/los-angeles/house-cleaning/example-business/service/123456789"
}
输出
每次运行输出一行结果(展平为CoreClaw结果表):
列 Key 类型
URL url 文本
评论数 review_count 整数
评分 overall_rating 数字(例如4.7 — 来自评论摘要的分数,不含形容词)
入职次数 hired_count 整数(未显示时为null)
找到的入职评论数 qualified_reviews_found 整数
评论N评论人/评分/日期/评论N文本 review_N_reviewer, review_N_rating, review_N_date, review_N_text(N=1..5) 文本/整数/文本/文本
缺失的值为null — 不会虚构任何内容。失败时,Worker会推送错误行(status, error, url)代替。
工作原理
通过Playwright connectOverCDP连接到CoreClaw的远程指纹浏览器,使用CoreClaw提供的PROXY_AUTH和ChromeWs环境变量。不会硬编码或记录任何凭据。(在没有PROXY_AUTH的情况下 — 仅限本地开发环境 — 会回退到启动本地Chromium。)
等待渲染的业务内容,而非依赖networkidle。
评论数优先从JSON-LD结构化数据获取,然后从靠近页面标题的"N条评论"文本中提取;支持以逗号分隔的数字格式。
入职次数通过匹配文本"Hired X time(s)"获取(支持以逗comma分隔的数字)。
当存在"查看所有评论"控件时,展开完整评论部分;当Thumbtack提供排序控件时,切换为按最新排序;持续加载更多评论(点击按钮和懒加载滚动),直到收集到5条标记为Hired on Thumbtack的评论或无法加载更多评论为止。
每张评论卡单独作用域——Hired on Thumbtack标签必须属于该特定评论。截断的评论会在提取前展开(点击"Read more"),通过reviewer|date|text键去重,并从评论文本中移除UI标签(Read more, Helpful, Hired on Thumbtack等)。
项目文件
main.js Worker入口点
package.json Node依赖(playwright-core + CoreClaw SDK依赖)
input_schema.json CoreClaw UI输入表单
output_schema.json CoreClaw结果列
sdk.js CoreClaw SDK基础模块
sdk_pb.js CoreClaw SDK数据模块
sdk_grpc_pb.js CoreClaw SDK网络模块
注意事项
仅使用CoreClaw支持的浏览器/运行时机制 — 不绕过验证码,不进行身份验证,不注入Cookie。
少于五条符合条件的评论属于正常结果,而非错误。
探索商店中更多热门采集工具
by mn06pz6r
根据用户screen_name或user_id游客获取所有推文
by scraper
使用关键词、个人资料、话题标签、高级搜索查询和自定义筛选条件从 X 和 Twitter 提取推文。 按账户、日期、语言、互动数据、媒体类型、认证状态或地理条件进行搜索,并采集推文文本、作者数据、点赞、回复、转发、引用、时间戳、媒体及其他公开元数据。 使用 CoreClaw 进行社交聆听、情感分析、市场研究、品牌监控、内容研究和大规模 X 数据工作流。
by scraper
以结构化工作流查看 Instagram 账户的粉丝列表,并移除指定账户。 连接已授权的 Instagram 会话,加载粉丝列表,查看账户详情,并提供需要移除的粉丝用户名、个人资料 URL 或 Instagram ID。 使用 CoreClaw 管理粉丝清理,无需自行构建和维护浏览器自动化脚本。
by scraper
从 Facebook 个人资料中提取帖子和公开互动数据。 添加一个或多个 Facebook 个人资料 URL,连接已授权的 Facebook 会话,并采集帖子文本、图片、视频、评论、反应、分享、作者详情、时间戳、链接及其他可用的帖子元数据。 使用 CoreClaw 进行社交聆听、内容研究、情感分析、受众研究、归档和自动化社交数据工作流。