如何导出数据?
了解如何从 CoreClaw 下载和导出采集的数据。
通过控制台下载
Section titled “通过控制台下载”步骤 1:访问运行结果
Section titled “步骤 1:访问运行结果”- 进入控制台的 运行记录
- 点击运行 ID
- 等待状态显示”SUCCEEDED”
步骤 2:查看结果
Section titled “步骤 2:查看结果”在运行详情页面,您可以看到:
- 执行状态
- 采集的项目数量
- 执行时长
- 日志记录
步骤 3:选择导出格式
Section titled “步骤 3:选择导出格式”在控制台选择您偏好的格式(共 8 种):
| 格式 | 扩展名 | 适用场景 |
|---|---|---|
| CSV | .csv | 电子表格、数据分析 |
| JSON | .json | 开发者、API 集成 |
| JSONL | .jsonl | 按行分隔,便于流式处理 |
| XLS | .xls | 传统 Excel 工作簿 |
| XLSX | .xlsx | 现代 Excel 工作簿 |
| HTML | .html | 任意浏览器可查看 |
| XML | .xml | 传统与企业级流水线 |
| RSS | .rss | 阅读器与监控式集成 |
步骤 4:下载
Section titled “步骤 4:下载”点击格式按钮下载您的数据。
通过 API 导出
Section titled “通过 API 导出”对于自动化数据检索,可以使用 API。导出接口一次只处理一个 Worker Run,因此如果要批量导出很多次运行结果,需要自己编写脚本串起来完成。
获取运行结果
Section titled “获取运行结果”GET /api/v2/worker-runs/{runId}/result?offset=1&limit=20导出运行结果
Section titled “导出运行结果”GET /api/v2/worker-runs/{runId}/result/export?format=csv&filter_keys=title%2Cprice%2Curl支持的格式: csv、json、jsonl、xlsx、xls、xml、html、rss(大小写不敏感,默认 csv)。
启动或重跑 Worker 后,响应中的 data.run_slug 就是这里使用的 runId。详见导出 API 完整文档。
批量导出多次运行
Section titled “批量导出多次运行”如果每次 Task 执行都会生成一个独立 Run,目前没有一个接口可以一次性把所有 Run 合并导出。推荐写一个小脚本:先列出运行记录,再逐个导出、下载文件,最后在本地合并。
推荐流程:
- 调用
GET /api/v2/worker-runs?offset=1&limit=100分页获取 Run 列表。limit最大为100,如果有 12,000 个 Run,大约需要请求 120 页。 - 从列表响应中收集每个 Run ID。列表接口返回项里的
slug字段就是后续导出接口要用的runId。 - 对每个
runId调用GET /api/v2/worker-runs/{runId}/result/export?format=csv或format=json。 - 读取导出响应里的
data.download_url,再下载对应文件。 - 在本地合并下载后的文件。建议把
runId放进文件名,或合并时加一列runId,方便追溯每条数据来自哪次运行。
大批量导出时,总耗时取决于接口响应时间和文件下载大小。以 12,000 个 Run 为例,顺序执行需要对每个 Run 做一次导出请求和一次文件下载,通常要预留 1-2 小时。使用 5-10 路并发可以明显缩短总耗时,但需要处理 429 Too Many Requests 限流:遇到限流时降低并发,并在短暂等待后重试。
数据大小注意事项
Section titled “数据大小注意事项”| 大小 | 推荐方法 |
|---|---|
| < 10MB | 控制台下载 |
| 10MB - 100MB | API 流式传输 |
| > 100MB | 联系支持 |
为什么下载按钮被禁用?
Section titled “为什么下载按钮被禁用?”可能的原因:
- 运行尚未完成
- 没有采集到数据
- 账户余额不足
- 权限受限
解决方案: 刷新页面或检查运行状态。
数据为空怎么办?
Section titled “数据为空怎么办?”检查以下内容:
- 输入参数是否正确
- 目标网站是否可访问
- 反爬措施是否阻止
查看日志了解详细错误信息。