如何使用 NodeMaven 抓取浏览器:分步指南

NodeMaven 抓取浏览器让您运行真实的云端浏览器,用于 网络爬虫 和网站自动化。您可以从现成模板起步,编辑 Playwright 或 Puppeteer 脚本,使用原生 JavaScript,或用自然语言通过 AI 提示词描述整个工作流。
每个浏览器会话都已内置 NodeMaven 代理、托管式反检测、CAPTCHA 识别、可复用浏览器配置文件、Live Browser、控制台输出以及会话录制 已内置。
如今,网页自动化面临的环境更加严苛。根据 Imperva 2026 恶意机器人报告,自动化系统生成的流量 占2025年全部网络流量的53%以上。网站的应对方式是更严格地检查浏览器行为、IP 信誉、会话历史、位置信号和自动化特征。
NodeMaven 抓取浏览器 专为简单 HTTP 请求无法胜任的工作流而打造:动态页面、筛选器、表单、本地搜索结果、电商页面、房产列表、价格监控,以及 AI 辅助的数据提取。
什么是 NodeMaven 抓取浏览器?
NodeMaven 抓取浏览器是一款用于抓取和浏览器自动化的托管式云端浏览器。它可以浏览页面、点击元素、填写表单、提取结构化数据、保存截图,并帮助您直接在控制台中调试工作流。
您可以使用以下方式运行自动化: Playwright、Puppeteer、原生 JavaScript 或 AI 提示词。浏览器运行在 NodeMaven 的基础设施上,并采用 NodeMaven 的代理设置,因此浏览器的位置、时区、语言区域、地理定位和网络行为都与所选代理位置保持一致。
Scraping Browser 还包含 增强隐身, CAPTCHA 破解, Cloudflare Web Bot Auth, Ad Blocker、浏览器配置文件、Live Browser、执行日志、结构化结果、文件、截图和会话录制。
该功能面向拥有有效 NodeMaven 轮换住宅代理 订阅的客户开放。 无需另行支付浏览器运行费用。用户只需为浏览器会话期间产生的 NodeMaven 代理流量 付费。
最佳上手方式:快速开始、AI 提示词或代码
请根据您的工作流选择起点。
- 快速开始: 最适合首次试用。它会运行一个现成模板并附带示例目标 URL,让您在修改任何内容前先看到浏览器、脚本、控制台和输出。
- AI Prompt: 最适合非开发者。用自然语言描述目标页面、操作步骤以及您想采集的字段即可。
- Playwright、Puppeteer 或 Vanilla JS: 最适合希望自行掌控选择器、等待、导航、截图、文件和结构化结果的用户。
- 自定义浏览器: 适用于需要指定代理位置、邮编定位、粘性会话、可复用配置文件、CAPTCHA 破解或高级浏览器设置的工作流。
- API: 适用于工作流已在 Playground 跑通,需要从您的后端、队列、cron 任务、调度器或生产自动化系统中运行的场景。
当目标页面高度依赖 JavaScript、需要点击或表单交互,或按地区返回不同内容时,Scraping Browser 也比简单的 HTTP 抓取工具更适合作为起点。对于受 Cloudflare 保护的页面,请在适用情况下启用 增强隐身, CAPTCHA 破解,以及 Cloudflare Web Bot Auth (如适用)。
如果抓取到的数据要进入 AI 或 RAG 流程,请让自动化脚本返回结构化 JSON,并将其传入您的数据库、向量索引、数据增强流程或存储层。
第 1 步:从「概览」标签页开始
当您 在 NodeMaven 控制台中打开 Scraping Browser,即 概述 标签页会最先打开。
首屏为您提供四个现成模板: 电子商务, B2B 数据增强, 房地产,以及 价格监控。每个模板都自带脚本和示例目标 URL,让您在构建自己的方案之前就能运行一个可用的浏览器自动化流程。
首次测试时,请选择一个模板并点击 快速开始。控制台会打开 Playground 并运行预置脚本。
在更改目标 URL 或代理设置之前,请先观察这一次运行。您会看到 Scraping Browser 如何打开页面、执行脚本、输出控制台日志并返回结构化结果。

第 2 步:在 Playground 中查看模板运行效果
点击后 快速开始,即 Playground 标签页会打开,模板脚本随即开始运行。
左侧是脚本编辑器、技术方案切换器和场景切换器。右侧显示 实时浏览器,您可以实时观看自动化运行过程。
运行过程中,您可以查看控制台输出、跟踪自动化步骤、检查结构化结果、生成文件、保存截图、停止脚本、浏览抓取的页面、将页面下载为 HTML,或在更大的标签页中打开浏览器。
Live Browser 让调试轻松得多。如果加载了错误的页面、选择器未命中元素,或网站弹出验证页面,您可以直接看到问题,而不必去猜测失败的 JSON 响应意味着什么。

第 3 步:编辑脚本或使用 AI 提示词
Playground 提供两种构建自动化的方式:编写代码或使用自然语言提示词。
面向开发者:编辑 Playwright、Puppeteer 或原生 JS
开发者可以自由切换 Playwright, Puppeteer,以及 Vanilla JS。您也可以选择四个场景模板之一,并针对自己的目标页面进行修改。
起初的改动通常都很简单:替换示例 URL、更换搜索关键词、调整选择器,或修改返回哪些字段。对于电商页面,这可能是采集商品名称、价格、评分、库存状态和商品 URL;对于房产页面,则可能是提取房源 URL、价格、地址和可租售状态。
如果您已经在本地使用浏览器自动化,Scraping Browser 可在同一套工作流中为您提供云端环境,包含代理路由、指纹设置、CAPTCHA 处理、Live Browser 和录制回放。NodeMaven 还提供了单独的指南: Playwright 代理设置 和 Puppeteer 代理设置 ,方便您对比本地与云端方案。
面向无代码用户:使用 AI Prompt
该 AI 提示词 标签页让您用自然语言描述工作流。
示例提示词:
写好提示词后,点击 Run prompt。浏览器会在屏幕右侧开始运行,结果以结构化 JSON 返回。

AI Prompt 在指令具体时效果最佳。请写明目标 URL、操作步骤、结果数量以及您需要的确切字段。
第 4 步:自定义代理、配置文件与浏览器设置
使用 自定义浏览器 ,适用于默认快速上手配置无法满足控制需求的场景。您可以从 Overview 标签页打开它,或直接进入 自定义设置 标签页。
您可以在这里于启动会话前准备好浏览器环境。
代理位置与轮换
Scraping Browser 仅可搭配 NodeMaven 代理使用。启动浏览器前,您可以选择会话应使用 住宅代理 还是移动流量,是仅允许 IPv4 还是允许 IPv4/IPv6 混合,以及浏览器应显示为来自哪个位置。
位置控制包括国家、地区、城市、ISP 以及 ZIP 级别定位。会话行为可设置为粘性、轮换或不轮换。
对于本地化抓取,这些设置决定网站返回的内容。如果您抓取 Amazon, Zillow,或在以下地区的本地商品列表 洛杉矶,您可以选择 美国 → 加利福尼亚州 → 洛杉矶 或用邮编定位进一步缩小位置范围。这有助于浏览器更稳定地看到当地价格、商品列表、库存情况、配送选项和地区版页面。
使用 住宅代理 适用于大多数公开网页抓取和特定位置的浏览场景。使用 移动代理 则适用于工作流需要运营商网络流量或类似移动端访问模式的情况。
在会话行为方面,请根据页面流程选择相应设置。轮换会话适合各自独立、可分别采集的页面。粘性会话适合分页、筛选、Cookie、登录状态和已保存的位置设置。不轮换适合单次浏览器运行,且 IP 需在会话结束前保持不变的情况。

浏览器配置文件设置
浏览器配置文件会在会话之间保存浏览器状态,可保留 Cookie、本地存储、缓存、浏览历史以及网站的登录状态。
只要网站自身的登录会话仍然有效,可复用的配置文件就能帮助在多次运行中保持同一浏览器身份。
例如,价格监控工作流可以复用同一配置文件,以保留位置偏好、筛选条件或会话 Cookie。B2B 数据补全工作流则可以使用配置文件,避免每次运行前都要重新设置同一门户网站的选项。
浏览器防护
Scraping Browser 提供多项浏览器层面的控制项,可在会话启动前进行调整。
增强隐身 用于管理指纹和反检测设置。 CAPTCHA 破解 用于处理受支持的 CAPTCHA 验证。 Cloudflare Web Bot Auth 为参与合作的 Cloudflare 网站签名请求。 Ad Blocker 拦截广告和不必要的资源,可减小页面体积并降低不必要的流量消耗。
这套方案取代了团队通常需要手动串联的多个独立工具:代理供应商、指纹层、CAPTCHA 破解服务、浏览器运行环境、日志工具和截图调试工具。
高级浏览器设置
高级设置涵盖浏览器模式、弹窗行为、会话时长和空闲超时。
使用 有头模式 适合调试时使用,因为您可以直接看到浏览器的操作。当工作流已经稳定、无需可视化检查时,请使用 无头模式 当工作流已经稳定、无需可视化检查时。
每个浏览器会话的最长 TTL 为 30 分钟。如果您的工作流需要更多时间,请将其拆分为多个较短的运行。
第 5 步:启动浏览器会话
设置完成后,选择 Playwright 或 Puppeteer,或选择四个模板之一。然后点击 启动浏览器会话.
NodeMaven 会创建已配置的浏览器会话,并返回一个 浏览器连接 URL.
开发者可以复制该 URL,通过 CDP 使用 Playwright 或 Puppeteer 连接到正在运行的浏览器。希望继续在控制台中测试的用户可以点击 打开 Playground 并在其中运行已配置的会话。
这一步将控制台配置与生产环境自动化连接起来。您可以先可视化测试浏览器,确认代理和浏览器设置无误,然后在自己的代码中复用该连接 URL。

第 6 步:用配置文件复用工作流
配置文件适用于需要跨会话记住浏览器状态的工作流。
打开 个人主页 标签页,然后点击 创建配置文件。填写名称和描述,然后选择该配置文件是否存储浏览器缓存。您还可以固定首次会话使用的位置。
配置文件适合周期性价格监控、需登录的控制台、电商平台核查、B2B 门户,以及带有已保存筛选条件的房产搜索。
每个账户最多包含 10 个浏览器配置文件 (默认设置)。
配置文件与会话不同。会话是一次浏览器运行,最长 TTL 为 30 分钟。配置文件则存储可在多个会话中复用的浏览器状态。

第 7 步:查看与调试会话
该 会话 标签页显示进行中和已完成的浏览器运行。
在此页面,您可以查看会话状态、手动终止进行中的会话、打开会话详情、观看会话录制,以及调试已完成的自动化任务。
状态含义一目了然。 Ongoing 表示会话仍在运行。 成功 表示自动化已完成。 失败 表示自动化因错误而结束或未能完成。
每个浏览器会话的最长 TTL 为 30 分钟。会话录制和调试数据的保留期为 3 天.
如果自动化卡住,请打开该会话,查看 Live Browser 或录制内容,停止运行,更新脚本或提示词,然后启动新会话。

控制台与 API:分别适用于哪些场景
在工作流仍处于搭建阶段时,请使用控制面板。它是测试模板、编写 AI 提示词、调试选择器、观察 Live Browser、查看控制台输出以及检查 JSON、文件或截图最方便的地方。
当工作流在 Playground 中运行正常,并且需要从您的后端、调度程序或生产自动化系统中运行时,请使用 API。
对于定时任务和云端执行,可通过 API 将 Scraping Browser 接入您的后端、队列、cron 任务或调度程序。 浏览器会话在云端运行,而您的系统负责控制何时启动会话、打开哪个目标网站,以及如何处理返回的数据。
API 密钥可在以下位置获取: 概述 页面。应用程序可以使用 Playwright 或 Puppeteer 通过 CDP 连接到正在运行的浏览器。
一个清晰的工作流通常是这样的:
- 在 Playground 中测试自动化。
- 自定义代理和浏览器设置。
- 确认输出结果。
- 将可用的流程迁移到 API。
这样可以让生产代码更加整洁,因为在开始集成之前,控制面板已经暴露了大部分抓取问题。
价格与限制
NodeMaven Scraping Browser 拥有 不收取单独的浏览器使用费。客户只需为以下内容付费: NodeMaven 轮换代理流量 付费。
也就是说,浏览器运行时长、Live Browser、AI 提示词、CAPTCHA 破解和会话录制均 不额外收费.
如果您是第一次试用 NodeMaven,您可以 从以下内容开始 750 MB 住宅和移动代理流量,仅需 $3.50。之后, 轮换住宅和移动代理套餐 起价为 $2.20/GB.
用户可在以下位置查看流量用量: 控制台 → 按域名细分 → Scraping Browser。目前单个会话尚不支持自定义流量上限,但您可以随时手动终止正在进行的会话。
默认限制:
| 限制 | 默认包含 |
| 浏览器配置文件 | 最多 10 个 |
| 活跃浏览器会话 | 最多同时 50 个 |
| 最长会话 TTL | 30 分钟 |
| 录制保留时长 | 3 天 |
NodeMaven 抓取浏览器的最佳应用场景
当目标网站需要真实浏览器、稳定的地理位置、页面交互或可视化调试时,Scraping Browser 是合适的方案。
电子商务抓取
电商页面通常包含 JavaScript、筛选器、弹窗、地区设置、商品卡片和动态价格模块。
NodeMaven 的 Scraping Browser 可以从渲染后的页面中采集商品标题、价格、库存状态、评分、商品 URL 和截图。相关工作流程可参阅 NodeMaven 的以下指南: 价格抓取 和 Amazon 数据抓取.
B2B 数据增强
B2B 数据补全流程通常涉及搜索框、筛选器、目录页、资料页以及结构化提取。
Scraping Browser 可以浏览公开的企业名录、采集可见的企业字段,并返回结构化 JSON。AI 提示词还能帮助非开发人员描述提取流程,无需手动编写选择器。
房产数据抓取
房产网站的搜索结果常会随地理位置、筛选条件、地图视图、邮编和房源可用性而变化。
Scraping Browser 可以采集房源、价格、地址、可用状态和本地搜索结果。在本地化场景中,邮编定位可以让浏览器看到正确的区域版本页面。
价格监控
价格监控需要一致性。如果网站会存储地理位置、货币、配送选项或筛选条件,自动化流程就应避免地理位置随机变化。当同一流程需要反复运行时,请使用粘性会话或可复用的浏览器配置文件。
AI 与 RAG 数据采集
Scraping Browser 可以返回结构化 JSON、文件、截图和提取出的页面数据,因此非常适合需要将采集到的网页数据导入数据库、向量索引、数据补全管道或 RAG 系统的 AI 工作流程。
在这类流程中,请让浏览器任务保持专注:加载页面、提取字段、校验输出,然后将干净的结构化数据传给下游。
常见问题与解决方法
页面显示的地区不正确
请检查国家、地区、城市、邮编定位、浏览器配置文件和代理会话设置。
如果网站将地理位置存储在 Cookie 中,请在测试新地区前复用正确的浏览器配置文件或清除旧的状态。
自动化流程卡住了
打开 Live Browser 并查看控制台输出。如果浏览器在等待错误的元素、被弹窗挡住,或页面加载缓慢,请停止会话,修改脚本或提示词后重新运行。
已完成的会话也可以通过录制回放来复查。
登录状态丢失
请使用持久化的浏览器配置文件。配置文件可以保留 Cookie、本地存储、缓存、浏览历史和网站的登录状态。
如果登录状态仍然丢失,可能是网站自身的会话已过期或已使该登录失效。
CAPTCHA 反复出现
请保持启用 CAPTCHA Solver,然后检查代理质量、请求速度、会话行为和网站限制。
CAPTCHA 破解可处理受支持的验证类型,但反复出现 CAPTCHA 通常意味着该流程需要放慢操作节奏、提升会话连续性,或改用其他代理配置。
流量消耗高于预期
大型页面、图片、视频、广告、重试以及卡住的会话都会增加流量消耗。在合适的场景下请启用广告拦截器,并手动结束卡住的会话。
查看用量请前往 控制台 → 按域名细分 → Scraping Browser 即可查看总流量及各域名的流量明细。
结论
体验 NodeMaven Scraping Browser 最简单的方式是从控制台开始。先使用 快速开始,在 Playground 中观察模板的运行过程,然后编辑脚本或切换到 AI 提示词 以实现无代码工作流。
使用 自定义设置 当工作流需要指定地理位置、粘性会话、浏览器配置文件、CAPTCHA 破解或高级浏览器设置时使用。当自动化流程能够返回正确的 JSON、文件或截图后,即可通过 API 将其投入生产环境,并与 Playwright 或 Puppeteer 对接。
对于已经在使用 NodeMaven 代理的团队来说,Scraping Browser 省去了大量配置工作。浏览器运行环境、AI 提示词、CAPTCHA 破解、Live Browser 和会话录制均已包含在内。您只需为浏览器会话期间使用的代理流量付费。



