葫芦流 · 场景
生成翻页 URL 并批量抓取
用 URL 生成节点,代替手改查询参数。
翻页指站点把目录拆成 page=1、page=2…。URL 生成器构造这些地址;抓取节点逐页读取。这比维护手写列表轻松。
已完成单 URL 抓取、现在需要更多列表页的新手。
-
01 翻页与列表
range 模式用 start 到 end(加 step)填充 {page}(或你的 param 名)。URL 可预测时用它。规律不规则时用 list 模式,每行一个完整 URL。
务必预览生成数量。若预览显示数百条,确认是否真的要在一次运行里全部抓完。
-
02 连到抓取
生成器没有输入。从其输出端口连到抓取输入。抓取用 list 模式,读取每条生成 item 的 url 字段。
生成器已连接时,抓取上通常不必再填种子 URL——上游列表会提供。仍需用代表性样例(常为第 1 页)做字段发现,以便有列可选。
-
03 上限
有两道不同上限。生成器:最多 500 条。抓取:默认每次运行处理 20 个 URL。若生成 40 页,把 scrape.limit 提到至少 40,或拆成两个生成器/工作流。
额度按实际请求网页次数计费,不是按「生成了多少 URL」。生成 40 页但只抓 5 页,只扣 5。
-
04 再入库
加存储,键用 url(或商品链接),以便重跑 upsert。之后可加通知。第一次成功运行后打开数据集。
若部分页面失败,打开该次运行的抓取节点输出/错误——可能是某页被拦或目录中途改版。
额度与失败
运行失败时,打开该次运行,阅读失败节点的 error 与输出——不要只看工作流列表猜测。URL 生成最多 500 条。抓取节点默认每次运行 20 个 URL(生成更多页时请提高 limit)。额度按套餐发放,运行按实际请求网页次数扣减。额度不足时运行返回 HTTP 402。
失败时先打开该次运行的节点 error,不要只看工作流列表。
接下来
批量列表跑通后,可接详情与价格监控。