葫芦流 · 文档中心

开始使用

面向业务与开发者的托管网页抓取工作流

葫芦流把公开网页变成可调度、可下载、可通知的表格——在画布上搭 URL 生成 → 抓取 → 存储 → 通知,不必手写选择器或运维爬虫。

为什么选葫芦流

痛点 自建方案 葫芦流
选择器维护 手写 CSS,站点一改就挂 AI 字段发现 + 画布配置
多页抓取 自写翻页与队列 URL 生成节点 + 调度运行
调度与存储 自建 cron + 数据库 工作流 + 数据集一体
变化通知 自写 diff + 邮件 通知节点(新数据 / 字段变化)
规模化与 API 自建 REST 与重试 Bearer Key + `/api/v1/*`

三个核心能力

分析 — 发现字段

粘贴公开 URL,用自然语言描述关心的列;首页分析或 API 预览返回字段与样例行。

curl -X POST https://huluflow.com/analyze \
  -H "Content-Type: application/json" \
  -d '{"url": "https://books.toscrape.com/", "requirement": "title, price, url"}'

# Or preview inside a workflow:
curl -X POST https://huluflow.com/api/v1/workflows/{id}/preview \
  -H "Authorization: Bearer $HULU_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/list", "fields": ["title", "price"]}'

运行 — 执行流水线

触发工作流运行:按图依次执行 URL 生成、抓取、存储、通知。额度按实际请求网页次数计。

curl -X POST https://huluflow.com/api/v1/workflows/{id}/run \
  -H "Authorization: Bearer $HULU_KEY"

导出 — 读取数据集

分页读取行或导出 CSV/JSON,供 BI、脚本或下游系统消费。

curl "https://huluflow.com/api/v1/datasets/{id}/rows?page=1&page_size=50" \
  -H "Authorization: Bearer $HULU_KEY"

curl -L "https://huluflow.com/api/v1/datasets/{id}/export?format=csv" \
  -H "Authorization: Bearer $HULU_KEY" \
  -o table.csv

资源