葫芦流 · 约 15 分钟
入门
第一条工作流:一个公开列表页 → 勾选列 → 一张以后能打开的表。
你不用写 HTML 选择器。粘贴公开 URL,用日常语言描述关心的列,让葫芦流发现这些列,勾选要保留的,再点运行。只有样例抽取看起来对了,再加存储(落库)和通知(邮件)。
读者:第一次用葫芦流的人。需要浏览器、邮箱,以及你有权采集、且无需登录的公开网页。
- 注册
- 抓取
- 发现字段
- 运行
- 入库
开始之前
先确认这几条,能少走弯路。任一不满足,请先换一个样例 URL。
- 01 使用公开 http(s) 列表或详情页(尽量无登录墙、无验证码)。
- 02 优先选较小的目录/列表页,字段发现会更快。
- 03 免费版每月 20 额度——运行时按实际请求网页次数扣。
- 04 中文界面在 /zh/,英文在 /。随时可切换。
你会看到的词
可以先跳过,用到时再回看。下面几条能覆盖大部分产品概念。
工作流 — 放画布(流水线)的那个命名项目。
节点 — 画布上的一个方块(抓取、URL 生成、存储、通知)。
运行 — 整条流水线从左到右执行一次。
数据集 — 存储节点写入的表;在「数据集」里浏览或导出 CSV/JSON。
额度 — 套餐池;抓取节点每实际请求 1 个网页扣 1 额度。
字段发现 — 打开样例 URL,提出候选列,由你勾选保留。
六步操作
每一步都写了「你应该看到」和「卡住时」——照着做即可,不必一次读完全文。
-
01
创建账号
打开注册,填写邮箱和至少 8 位密码并提交。进入控制台总览。免费账号每月 20 额度,足够试完整流水线。
之后用同一站点登录即可。没有「安装包」——葫芦流在云端运行。工作流一旦设为启用并配置间隔,即使笔记本关机也会按调度执行。
你应该看到: 总览页有额度用量、最近工作流,以及工作流 / 数据集 / API 密钥入口。
卡住时: 邮箱已注册 → 去登录。语言不对 → 切到 /zh/ 或 /。找不到控制台 → 登录后从应用菜单打开「工作流」。
-
02
新建工作流并添加抓取
进入「工作流」→「新建」。起一个好认的名字(如「演示列表」)。打开编辑器,从面板拖一个抓取节点到画布,点选节点打开右侧配置。
在 URL 里粘贴一个公开列表地址。模式选 list(一页上有多条商品/行)。在「需求」里用日常语言写列,例如:标题、价格、商品链接。这是在描述意图,不是写 CSS。
你应该看到: 画布上有抓取方块;配置里有 URL、列表/详情模式、需求、抓取字段。
卡住时: 运行返回 402 → 额度不足。升级或等下个周期。保存图不消耗额度。
-
03
发现字段并勾选列
点击「抓取字段」(或同等发现操作),等待样例返回。会看到候选列和几行样例。只勾需要的列——列越少,后面表格越干净。在节点上点应用/保存,把 fields 写进抓取配置。
保存抓取预设前必须至少勾选一列。在画布上,发现后务必先应用再依赖「运行」。若发现结果无用,换 URL 或改需求文案再试。
你应该看到: 发现列的勾选列表,以及样例行数值。
卡住时: 没有字段 — URL 必须可公开访问。登录页、软 404、验证码页通常发现不了。先换更简单的公开列表页。
-
04
运行一次并查看输出
点击运行,等到结束(控制台与 API 都会等跑完)。打开最近一次运行。每个节点有 ok/error,以及输入输出。抓取的 output.items 是行对象数组。
若为 error,先看该节点的 error——常见是缺 URL、配额、或抓取引擎失败。改配置、保存、再跑。在抓取输出看起来正确之前,不要加存储。
你应该看到: 运行状态 ok/error;抓取输出里的 items 能对上页面内容。
卡住时: 「抓取需要 URL」— 填写 URL,或连接 URL 生成器 / 上游链接字段。items 为空 — 模式可能选错(list/detail),或页面结构变了;重新发现字段。
-
05
添加存储并写入数据集
添加存储节点。从抓取输出连到存储输入。在存储配置里把 key_fields 设为稳定身份——几乎总是商品或档案的 url。可选设置 dataset_name(如「演示商品」)。再运行一次。
打开控制台 → 数据集,应能看到表和行。之后相同键的运行会更新同一行(upsert),而不是重复插入。监控靠这个保持干净。
你应该看到: 数据集有行数;打开后能看到列与数据。
卡住时: 只用标题做键容易撞车。优先用唯一商品 URL。表为空时,确认 scrape → store 的连线,以及抓取确实产出了 items。
-
06
调度与可选通知
设置 interval_minutes(1440=每天,60=每小时,视套餐而定)。status=active 才会被云端 worker 调度;paused 只能手动运行。可选在抓取或存储后加通知:when=new 表示全新行,when=field_change 并设置 watch_fields(如 price)表示关注字段变化。
「采集」通常是每次运行都入库。「监控」是同一张图加上调度和变更通知。可随时在数据集页导出 CSV/JSON(受导出行数上限约束)。
你应该看到: 启用后工作流上有 next_run_at;通知可在节点配置里试跑(dry-run 不发信)。
卡住时: 没有自动跑 — 状态是暂停,或间隔为空(仅手动)。没有邮件 — 检查 when/watch_fields,以及是否已有上次运行可供比较。
新手常见问题
需要会编程吗?
不需要。控制台就能搭建、调度、浏览表和导出。API 是给希望在别的系统里自动化同样步骤的工程师用的。
为什么我的网站字段发现失败?
抓取引擎只适合可公开访问的页面。需要登录、强力拦爬虫或验证码的站点常常失败。先从简单公开列表开始。你也有责任只采集你有权使用的网站。
什么会计入额度?
抓取节点实际请求网页才扣额度(1 次请求 = 1 额度)。URL 生成、存储、通知不扣。保存图不扣——运行才扣。
接下来读什么?
先读《概念》,再读《工作流与节点》。在编辑器里打开 AI 聊天 Tab,用自然语言描述对当前图的修改。
保存画布会扣额度吗?
不扣。只有运行成功且抓取节点实际请求了网页才扣额度。
可以先不设调度吗?
可以,也推荐。先手动跑通 scrape → store,确认数据集行正确,再设 interval 并改为启用。
接下来
入门只覆盖最简路径。下面按你的目标选一篇继续。