葫芦流 · 浏览器插件

Chrome 插件完全入门

不用写代码、不用懂爬虫——在浏览器里对着网页说你要什么,三步保存成可重复运行的采集任务。

如果你第一次听说「工作流」「抓取」「数据集」,完全没关系。本页假设你只会用 Chrome 浏览网页,目标是:打开一个商品列表或文章目录,把标题、价格、链接等整理成表格,并在葫芦流网站里随时查看或导出。插件是在浏览器右侧打开的小面板,不会改动你正在看的网页。

读者:零基础用户。需要 Chrome 浏览器、葫芦流免费账号、以及你有权访问的公开网页(无需登录即可打开的那种)。

约 20 分钟 从零安装插件,完成第一次保存并用工作流标签插件运行
  1. 安装登录
  2. 分析字段
  3. 选方案保存
  4. 插件运行
  5. 看数据
  6. 暂停/定时

插件到底帮你做什么?

想象你在 Excel 里做一张表,列是「标题」「价格」「链接」,行是网页上的每个商品。手工复制粘贴很慢。葫芦流插件的作用是:你告诉它「我要这些列」,它先读当前页面、猜出对应位置,再帮你生成一条自动化流水线,以后可以一键再跑、或定时再跑。

和控制台(网站里的画布编辑器)相比,插件更适合「我现在正开着这个页,就想从这个页开始」的场景。复杂改图、定时、邮件通知仍可在控制台完成;插件负责快速起步。

你不需要安装 Python、不需要写 CSS 选择器、不需要懂 XPath。插件会读取当前页面 HTML 并上传到葫芦流做字段识别(与控制台同一套 AI);真正抓取时则在浏览器后台按 XPath 打开标签页读取内容,并把数据流式写入你的数据集。

插件负责「从当前页快速建任务 + 在浏览器里跑抓取」;控制台负责「改图、定时、云端跑、导出」。两者共用同一账号、同一批工作流和数据集。

重要:请只采集你有权使用的公开数据。需要登录、验证码或明确禁止抓取的网站,可能分析或运行失败——这不是插件坏了,而是产品故意不做绕过。

开始之前,请确认这些

第一次使用建议选一个简单的公开列表页练手(例如书籍目录、公开商品列表),成功一次后再换目标站点。

  • 01 已安装 Chrome(或基于 Chromium 的浏览器,如 Edge 需自行确认插件兼容)。
  • 02 已在 huluflow.com 注册账号(免费套餐含每月 20 次网页请求额度,保存工作流本身不扣额度)。
  • 03 练手用的 URL 在无痕窗口能直接打开,不需要登录。
  • 04 知道你想采什么:用中文写几个词即可,例如「标题、价格、商品链接」。
  • 05 若公司网络拦截扩展,请联系管理员允许安装 Chrome 扩展。
  • 06 保存的工作流里应包含「抓取 → 存储」连线,否则运行后数据无法入库。

第一次见这些词?

插件和控制台里会出现下面几个词,先混个脸熟即可,不必背诵。

工作流 — 保存下来的整套采集方案,有名字,可在控制台打开编辑。

字段 — 表格的「列」,如 title、price、url;分析后会出现勾选列表。

分析 — 插件读取当前页并识别可能有哪些列;不等于已经采完整站。

数据集 — 存数据的表,在控制台「数据集」里查看,可导出 CSV。

列表页 / 详情页 — 列表页一行代表一条商品;详情页通常只有一个商品的长页。

额度 — 每次运行中,抓取节点每请求 1 个网页扣 1 额度;保存不扣。

运行 — 按工作流执行一次采集;可手动点,也可在控制台设定时。

侧边栏 — 插件界面贴在浏览器窗口右侧,切换标签页时「当前页面」URL 会跟着变。

插件运行 — 在「工作流」标签对已保存任务发起抓取;后台自动开页、可暂停/继续,适合大量 URL。

Checkpoint — 流式运行中每抓若干条就向服务器提交一次进度并入库(默认每 5 条一批),避免一次上传过多数据。

两个标签页:构建 vs 工作流

顶栏有两个主标签,用途不同。第一次用多在「构建」;保存后日常运行多在「工作流」。

  1. 构建

    对着当前打开的网页:写抓取要求 → 分析 → 三步向导 → 保存(可选立即运行一次)。适合从 0 创建新任务。

  2. 工作流

    列出账号下已保存的工作流。可对每条任务「插件运行」「暂停」「继续运行」,或「加载到这里」回到构建页修改后再保存。

  3. 何时用哪个?

    新站点 / 页面改版 → 构建 + 重新分析。已配好、要定期或大批量抓 → 工作流 → 插件运行。定时调度仍在控制台设置。

打开插件后,界面长什么样?

下面按从上到下顺序说明。若某块是灰的或隐藏的,说明还没登录或还没分析,按步骤做就会出来。

  1. 01 顶栏:品牌、构建/工作流、语言

    「构建」用于新建采集;「工作流」列出你已保存的任务。右上角 EN/中 可切换界面语言(中文下品牌显示「葫芦流」)。

  2. 02 登录横幅

    未登录时提示去网站登录;登录成功后会显示你的邮箱。插件不单独存密码,与浏览器里 huluflow.com 的登录态共享。

  3. 03 当前页面 + 使用说明

    显示正在分析的标签页地址;右侧「使用说明」链到本文档。换标签后地址会变,需重新分析。

  4. 04 抓取要求 + 分析按钮

    在输入框用日常语言写想要的列,点「分析这个页面」。分析完成前按钮会显示进度(读取页面、上传、识别字段)。

  5. 05 步骤条 1 → 2 → 3

    分析完成后出现:① 确认字段 ② 选择工作流方案 ③ 命名保存。可点步骤数字回看,底部有「下一步」按钮。

  6. 06 构建页:底部固定按钮

    步骤 1、2 显示「下一步」;步骤 3 显示「保存工作流」。滚动时顶栏与底栏保持可见。

  7. 07 工作流标签:列表与运行

    每条工作流显示名称、状态(启用/暂停)、节点数、上次运行时间。运行中会显示进度徽章(如 detail 3/10)。按钮:控制台查看、加载到这里、插件运行、暂停、继续运行。

  8. 08 设置(⚙)

    可改「服务地址」(默认 https://huluflow.com,仅自建部署需改)和界面语言。修改后点保存;登录态仍依赖浏览器 Cookie。

三步构建在干什么?

可以把它理解成:先确认列 → 再选自动化方案 → 最后起名保存。

步骤 你要做什么 完成后得到什么
① 确认字段 勾选要保留的列,左右滑动看样例数据 确定这张表有哪些列
② 选择工作流 点选推荐方案,可改页码范围、数据集名称等 后台生成可运行的流水线草图
③ 命名保存 必填工作流名称,可选保存后立即运行 工作流出现在你的账号里,可在控制台继续编辑

跟着做:从零到第一次保存

建议电脑旁打开一个练手列表页,边读边操作。每步下面的「你应该看到」和「若卡住」帮助自查。

  1. 01

    安装并打开侧边栏

    在 Chrome 网上应用店搜索「葫芦流」或「HuluFlow」安装(内测阶段也可能由团队提供解压文件夹,在 chrome://extensions 开启「开发者模式」→「加载已解压的扩展程序」)。

    安装后点击工具栏上的扩展图标,选择「打开侧边栏」。建议右键图标 →「固定」,以后一点就开。

    侧边栏较窄,可拖拽浏览器窗口变宽以便看清预览卡片。

    你应该看到: 侧边栏打开,顶部显示 HuluFlow/葫芦流 和「构建」「工作流」两个标签。

    卡住时: 若图标菜单里没有侧边栏,更新 Chrome 到较新版本,或重新加载扩展。

  2. 02

    注册并登录

    若还没有账号:在浏览器新标签打开 huluflow.com/zh/register 注册(邮箱验证后登录)。

    在插件里点「去登录」,会在新标签打开登录页;登录成功后回到侧边栏,横幅应显示「已登录」和你的邮箱。

    若一直显示未登录:确认插件设置里的「服务地址」是 https://huluflow.com(自建部署才需改)。

    你应该看到: 登录横幅变绿或显示邮箱;「去登录」按钮消失。

    卡住时: 登录态依赖浏览器 Cookie。若你清过 Cookie,需要重新登录一次。

  3. 03

    描述需求并分析(步骤 ① 之前)

    在 Chrome 里打开你的练手列表页,确保侧边栏顶部「当前页面」的 URL 正确。

    在「提出你的抓取要求」输入框写想要的列,例如:标题、价格、链接。不必写技术术语。

    点击「分析这个页面」。等待进度条走完(通常十几秒到一分钟,取决于页面大小)。

    你应该看到: 出现步骤条 1-2-3,自动进入步骤 ①;上方有「列表页」或「详情页」标签。

    卡住时: 分析会消耗一点时间和网络,请保持该标签页在前台或至少未被浏览器休眠。

  4. 04

    步骤 ① — 确认要采集的内容

    「要采集的内容」下列出 AI 找到的字段,默认全选。不需要的列取消勾选即可。

    下方「数据预览」可左右滑动,查看页面上真实样例行,确认价格、标题没有对错列。

    若列表页含商品链接,插件可能在后台再分析一个详情页,以便步骤 ② 推荐「列表→详情」方案——此时可能短暂显示「正在分析详情页」,属正常现象。

    你应该看到: 预览里每卡片的多列与勾选的字段一致;明显乱码或空列应回到上一步改要求或换 URL。

    卡住时: 字段名来自网页本身(常为英文),界面语言不会翻译字段名,这是预期行为。

  5. 05

    步骤 ② — 选择工作流方案

    点击「下一步」进入方案列表。每个卡片是一种常见用法,例如:只采当前页、翻多页列表、列表进详情再入库等。

    点选最贴近你目标的一条。下方可能出现可调项:页码范围(从第几页到第几页)、数据集名称、通知邮箱等。

    数据集名称会按网站自动生成(可在控制台「数据集」里找到),也可改成你记得住的名字,如「京东图书 2026-03」。

    你应该看到: 选中的方案有高亮;页码范围 Preview 合理(不要一次生成几百页)。

    卡住时: 不确定选哪个时,先选最简单的「单页抓取」跑通一次,再在控制台加翻页或详情。

  6. 06

    步骤 ③ — 命名、保存,(可选)立即运行

    「起个名字」必填,例如「练手-图书列表-3月」。插件不会替你自动填,避免一堆叫 Untitled 的任务。

    勾选「保存后立即运行」会在保存后立刻采一次(会扣额度)。第一次建议勾选,方便马上看有没有数据。

    点「保存工作流」。若勾选了立即运行,会在当前页用浏览器抓一次(一次性提交,适合快速验证)。若未勾选,之后请到「工作流」标签点「插件运行」做正式抓取。

    你应该看到: 控制台 → 工作流 里出现新名字;若立即运行了,构建页下方会显示采到多少行。

    卡住时: 保存本身不扣额度。立即运行与插件运行都会扣抓取额度(每请求 1 个网页约 1 额度)。

  7. 07

    在工作流标签 — 插件运行

    切到「工作流」标签,找到刚保存的任务,点「插件运行」。插件会在后台依次打开 URL 抓取(不必保持原列表页在前台),顶部显示 Running 与进度。

    运行采用流式模式:服务端创建 Run → 每抓一批数据 checkpoint 入库 → 全部完成后 finish。数据集可在控制台实时刷新查看。

    运行中可点「暂停」;暂停会关闭当前抓取标签并保存进度,之后点「继续运行」从断点续抓。同一工作流同时只能有一个活跃任务。

    你应该看到: 进度徽章更新;完成后显示采到行数或 partial/error;控制台数据集行数增加。

    卡住时: 大批量(多页列表、列表→详情)请用插件运行而非「保存后立即运行」,以便暂停与流式入库。

插件运行是怎么工作的?

「插件运行」是工作流标签里的正式抓取方式,与构建页「保存后立即运行」不同,适合多 URL、可暂停、大数据量。

  1. 1. 启动 Run

    点击插件运行后,插件向服务器 POST /run/start,创建一次 WorkflowRun 并占用 1 点启动额度。

  2. 2. 后台开 tab 抓取

    Background 按工作流图拓扑执行:URL 生成 → 抓取节点。对每个 URL 在后台打开标签页,用 content script 按 XPath 提取字段(支持翻页配置:页码链接、无限滚动、加载更多)。

  3. 3. 流式 checkpoint 入库

    每抓一批行(默认 5 条)POST /run/{id}/checkpoint,服务器 upsert 到 store 节点关联的数据集。不必等全部抓完才看到数据。

  4. 4. Finish 收尾

    全部 URL 处理完后 POST /run/{id}/finish,服务端跑剩余节点(store 若已入库则跳过、notify 等),标记 Run 为 ok/partial/error。

  5. 5. 暂停与继续

    暂停时:中止当前 tab、保存 checkpoint(completed_urls、next_index)。继续时从断点续跑,不重复已入库的行。暂停状态同步到服务器。

  6. 6. 前提条件

    工作流图必须有 scrape → store 连线;否则 checkpoint 会丢弃数据。抓取额度足够;插件已登录且 Background 未被浏览器杀掉(长时间运行请保持 Chrome 打开)。

技术说明:插件运行不经过 bulk POST /run 一次性提交全部 items,而是 start → checkpoint × N → finish。控制台「运行」按钮走的是云端 crawld 路径,无需扩展参与。

两种运行方式对比

保存后立即运行(构建页) 插件运行(工作流标签)
保存后当场在浏览器抓当前图 对已保存工作流随时发起,不依赖当前前台页
一次性提交 browser_payload 流式 checkpoint,默认每 5 条入库一次
无暂停/进度徽章 可暂停/继续,列表显示进度与状态

设置

点顶栏 ⚙ 打开设置面板。

  • 01服务地址:连接 huluflow.com 或你的自建实例;必须与登录网站一致,否则 Cookie 无法同步。
  • 02语言:切换后界面与文档链接(使用说明)会切到中文或英文路径。

保存之后,还可以做什么?

插件完成了「从 0 到 1」。日常抓取、改图、定时与导出主要在控制台完成。

  • 01 工作流标签 →「插件运行」:对已保存任务做正式、可暂停的大批量抓取。
  • 02 控制台 → 数据集:浏览表格、分页、导出 CSV/JSON、删除单行或清空数据。
  • 03 控制台 → 工作流 → 打开:在画布上改节点、设 interval_minutes 定时、加邮件通知。
  • 04 工作流标签 →「加载到这里」:把已有任务载入构建页,改字段或方案后另存。
  • 05 页面改版或换 URL 后:在构建页点「重新分析」,不要直接跑旧配置。
  • 06 需要纯云端抓取(不开浏览器 tab)时:在控制台点「运行」,由 crawld 在服务端执行。

常见疑问(小白版)

我完全不懂编程,能用吗?

可以。全程点按钮和填中文描述即可。只有在你要把葫芦流接到自己服务器时才需要看 API 文档。

插件和控制台是什么关系?

同一个账号、同一批工作流和数据集。插件是快捷入口;控制台是完整编辑器。在插件保存的工作流,打开控制台能看到同样画布。

分析免费吗?会扣额度吗?

分析页面(字段识别)不扣抓取额度。额度在「运行」工作流、且抓取节点请求网页时才扣。

为什么字段名是英文?

字段名来自网页 HTML 结构或 AI 命名,方便和技术列对应。你可以在控制台给列改显示名,或导出后用 Excel 改表头。

可以采需要登录的网站吗?

第一版面向公开页。若必须登录才能看到内容,请在已登录的浏览器标签打开该页再分析——有时能采到,但不保证,且请勿采集无权限的数据。

换了个标签页,为什么还是旧数据?

插件按 URL 记住进度。切换标签后看顶部 URL 是否变了;变了请点「重新分析」。

保存时必须填名字吗?

是。必填,且不会自动填。这样日后在列表和邮件里能认出是哪次任务。

Chrome 以外可以吗?

官方以 Chrome 为主。Edge 等 Chromium 浏览器可能可加载,Safari/Firefox 目前不支持此插件。

「插件运行」和「保存后立即运行」有什么区别?

立即运行适合保存后快速试一次(当前页、一次性提交)。插件运行适合多 URL、可暂停续跑、流式入库,在工作流标签发起。

为什么运行完数据集还是空的?

常见原因:工作流没有 store 节点或未连线;字段勾选不对;站点结构变了;额度不足。打开控制台该次 Run 的节点输出查看 failures。

插件运行和云端定时跑有什么区别?

插件运行在本地 Chrome 开 tab 抓取(需电脑开着 Chrome)。云端 run/worker 用 crawld 在服务器抓,适合定时任务、电脑关机也能跑。

出错了怎么办?

大多数问题属于「页面不合适」或「还没登录」,按下面逐项排查。

分析一直转圈或失败

检查:① 是否登录 ② 网络是否正常 ③ 页面是否需登录/CAPTCHA ④ 页面是否过大。换一个简单的公开列表页重试。

提示请先登录

在新标签打开 huluflow.com 登录后关闭该标签,回插件点刷新或重新打开侧边栏。确认服务地址正确。

预览数据是空的或明显不对

改「抓取要求」文案,写清你要的列;或换结构更规整的列表页。动态加载很多的站可能需要多等几秒再分析。

保存成功但运行 0 行

打开控制台看该次运行详情与 failures。常见:无 store 节点、字段不对、站点改版、额度 402。插件运行若显示 0 行但 failures 有记录,按失败 URL 排查。

切换中文后顶栏仍显示 HuluFlow

点 EN/中 切换后应显示「葫芦流」。若否,在扩展管理页重新加载插件。

提示「该工作流已在运行中」

同一工作流只能有一个 running/queued 任务。到工作流标签看是否仍在跑或卡在 pausing;等待完成或暂停后再试。也可刷新列表。

暂停后还在抓 / 暂停无效

更新到最新版插件后,暂停会关闭当前抓取 tab。若刚点暂停,可能需等当前页加载/提取完成(通常几秒内)。重新加载扩展后再试。

无法连接页面 / Receiving end

目标页刷新后重试。插件运行会在后台自动开 tab,不依赖 content script 预先注入当前页。若仍失败,检查是否拦截了扩展权限。

失败时先打开该次运行的节点 error,不要只看工作流列表。

第一次保存前的自检清单

全部打勾再点保存,成功率最高。

  • 01 练手 URL 在无痕窗口能打开,无需登录
  • 02 插件横幅显示已登录邮箱
  • 03 当前页面 URL 与你要采的页一致
  • 04 步骤 ① 预览里标题、价格等看起来对
  • 05 步骤 ② 选了合适的方案,数据集名称看得懂
  • 06 步骤 ③ 工作流名称已填;若立即运行,额度够用
  • 07 工作流方案含 store 节点(或推荐方案已自动带上)
  • 08 正式大批量抓取:保存后到工作流标签用「插件运行」,而非仅依赖立即运行

接下来

第一次保存并插件运行成功后,建议阅读《入门》了解控制台全貌,《工作流与节点》学习定时与通知,或《概念》理解运行与数据集。