Rightmove 爬虫:如何分步提取房产数据

Rightmove 爬虫可以从搜索结果中收集房源 URL、价格、地址、卧室数量、房产类型和中介名称。随后还可以打开单个房源页面,获取描述、产权类型、建筑面积、附近车站等详细信息。
在其 2025 年全年业绩报告中,Rightmove 表示 每天约有 10,000 条房源上传。在这样的数据量下,人工核查很快就会变得困难。自动化采集可以让房产研究、房源监控和内部数据集保持最新。
本教程展示如何使用 NodeMaven 抓取浏览器及其 房地产 模板和一段通俗语言的 AI 提示词来构建 Rightmove 爬虫。最终输出为结构化 JSON,主要流程 无需任何代码知识.
注意: Rightmove 的 使用条款 禁止在未经其法务团队事先书面同意的情况下使用机器人、爬虫程序、数据采集工具及其他自动化采集手段。仅当您已获得自动化访问的许可,并遵守该网站的条款及适用的数据保护规定时,才可按照本教程操作。
快速概览
| 您的起点 | 推荐工作流程 | 工作原理 |
| 没有编程经验 | 使用 AI 提示词 | 描述您需要的页面、操作和字段。Scraping Browser 会完成整个工作流程并返回结构化 JSON。 |
| 正在构建新爬虫 | 使用 Playwright、Puppeteer 或原生 JavaScript 模板 | 在 Playground 中编写并调试自动化脚本,同时在 Live Browser 中实时查看运行过程。 |
| 您已有爬虫 | 通过 Browser API 和 CDP 连接 | 保留您的数据提取逻辑,将浏览器会话运行在 NodeMaven 基础设施上。 |
| 您希望自行构建和管理爬虫 | 向 JSON 端点发送经授权的请求,并使用 Python 解析响应 | 由您自行管理请求、解析、代理、重试和维护工作。请参阅我们的 网络爬虫与 API 对比教程 了解完整的 Python 语言 工作流程。 |
前三种方案均使用 NodeMaven 抓取浏览器. 它们只是操作同一个托管浏览器的不同方式。第四种方案则是独立的自管理方式,基于对已授权 JSON 端点的直接请求。
下方教程采用 AI 提示词工作流程。开发者可以将相同的页面选择、分页、会话和验证原则应用于代码模板或现有的 CDP 连接爬虫。如果您更倾向于自行构建并维护直接的 Python 爬虫,可参考链接中的 API 采集指南。
可以采集 Rightmove 的数据吗?
您可以搭建技术层面的 网络爬虫 工作流程,但 Rightmove 限制自动化采集,依据是其现行的 使用条款.
公开可见的房产信息仍受该网站合同条款的约束。在运行 Rightmove 爬虫之前,请确认书面授权涵盖自动化访问、提取、保留,以及任何计划中对 Rightmove 内容的展示或链接。相关条款还限制未经同意链接到内部页面以及直接使用平台资源。您对数据的存储和使用也必须符合英国的数据保护规定。
在获得授权的前提下,爬虫可以采集搜索卡片和房源页面上显示的字段,包括:
- 房源 ID 和房源 URL
- 价格和价格说明
- 显示地址
- 卧室和浴室数量
- 房产类型
- 描述和主要特点
联系方式和其他个人数据需要比基本房源信息更严格的处理。请明确项目实际需要哪些字段、保留多长时间以及哪些人可以访问。
如需更全面地了解权限、数据库权利、个人数据和网站条款,请参阅我们的指南: 网络爬虫法律。NodeMaven 的 房产爬虫 页面还介绍了代理在各房源平台的房产数据工作流中的常见优势。
Rightmove 如何加载房源数据?
Rightmove 的房产信息可能出现在 已渲染的页面元素、嵌入的 JavaScript 数据以及内部请求 中,其中的内部请求由其搜索界面使用。具体结构可能随时变化,因此在决定提取方式之前,请先检查当前页面。
单个房源页面如何使用 PAGE_MODEL
单个房产页面通常会暴露一个名为 window.PAGE_MODEL的 JavaScript 对象。根据页面版本的不同,它可能包含房产 ID、地址、价格、描述、特色、中介信息、图片和位置数据。
PAGE_MODEL 只是一个通过观察得知的实现细节,并非有文档说明的公共接口。Rightmove 可以随时重命名它、更改其结构或将字段移至别处。生产环境的工作流需要对缺失字段进行检查,并具备检测结构变化的方法。
Rightmove 的内部搜索请求如何运作?
Rightmove 的搜索界面可以通过内部 JSON 请求加载房源数据。这些请求有时被称为“Rightmove 搜索 API”,但它们是网站的一部分,而非有文档说明的公共服务。通过技术检查,可能会发现用于位置、结果索引、每页数量、销售或租赁频道、价格区间以及卧室数量筛选的参数。
响应中可能包含房产记录、结果数量和分页信息。因此,当经授权的项目需要更小的 HTTP 负载时,直接提取 JSON 会很有吸引力。
然而, 该内部搜索端点并不是 Rightmove 有文档说明的公共房源 API。请求格式可能在不另行通知的情况下更改,直接请求也可能仍然依赖于网站生成的 Cookie、请求头或会话状态。
如果您想检查 JSON 端点并使用 Python 解析其响应, 我们的 网络爬虫与 API 对比教程 会逐步演示整个过程。本文其余部分将继续使用 Scraping Browser,它将页面渲染、代理支持、CAPTCHA 破解、页面导航、会话设置和可视化调试整合在同一个工作区中。
如何使用 NodeMaven Scraping Browser 采集 Rightmove
下面的操作演示使用 NodeMaven 中的 AI Prompt 爬虫浏览器。您只需描述目标页面、浏览器操作和所需字段,Scraping Browser 便会运行浏览器并返回结构化的 JSON。
如果您更喜欢写代码,同一个 Playground 也支持 Playwright、Puppeteer 和 Vanilla JavaScript。现有的 Playwright 和 Puppeteer 应用可以通过 CDP 连接到正在运行的浏览器。请查看 文档 了解更多详情。
第 1 步:准备一个已筛选的 Rightmove 搜索
打开 Rightmove,创建您的项目所需的精确搜索。选择出售或出租的房产,输入地点,设置搜索半径,并应用筛选条件。这些条件可以包括:
- 最低和最高价格
- 最少和最多卧室数
- 房产类型
- 上架时间段
- 必备特征
- 包含或排除选项
复制完成后的搜索 URL。从一个完整的 URL 开始,可以让第一次自动化更简单,因为浏览器无需再填写搜索表单。
第一次运行时, 只从一个页面采集三条房源。这样在添加分页之前,更容易将每条 JSON 记录与房源卡片逐一对比。

第 2 步:打开 Real Estate 模板
在 NodeMaven 控制面板中打开 Scraping Browser。Overview 页面提供了适用于电商、B2B 数据补全、房地产和价格监控的现成模板。
选择 房地产 并点击 快速开始。Playground 会打开一个预先准备好的自动化流程。编辑器和技术选择器显示在左侧,而 实时浏览器 显示在右侧。
在修改模板之前,您可以先观看它完整运行一次。您可以看到页面打开、跟踪每个步骤、检查控制台消息,并查看结构化结果。这为您提供了一次成功会话的参考。
如需了解控制面板每个部分的导览,请参阅完整的 NodeMaven Scraping Browser 指南.

第 3 步:配置英国浏览器会话
打开 Customize browser (位于 Overview 页面),或在启动会话前使用 Customization 部分。
对于 Rightmove 搜索,请使用以下初始设置:
| 设置项 | 初始选择 | 原因 |
| 代理类型 | 住宅代理 | 与普通家庭浏览连接一致 |
| 国家 | 英国 | 使连接和浏览器位置与目标市场保持一致 |
| 会话行为 | 粘性会话 | 在浏览筛选条件、分页和房源页面时保持同一 IP |
| 浏览器配置文件 | 首次运行时可选 | 如果工作流需要可复用的 Cookie 或已保存的状态,可稍后再添加 |
NodeMaven 抓取浏览器 会将时区、区域设置、地理位置和网络设置与所选代理位置保持一致。当所选代理池支持时,您还可以按 英国代理 进行区域、城市、ISP 或 ZIP 邮编级别的定向。
在一次连贯的搜索流程中请保持同一个粘性会话。在第一页和第二页之间轮换 IP 可能会丢失网站与该会话关联的连续性。
Scraping Browser 还提供受支持的 CAPTCHA 处理以及可选的资源拦截功能。 首次测试时请将可选设置保留为默认值。待基础工作流返回准确数据后,再逐项添加。

第 4 步:编写 Rightmove AI 提示词
切换到 AI 提示词 在 Playground 中。一条精确的提示词应包含搜索 URL、记录数量、链接模式、字段以及所需的输出格式。
首次测试请使用以下版本:
将占位符替换为您筛选后的 URL,然后按下 Run prompt。Live Browser 将显示浏览器操作过程,结果面板则会返回提取出的 JSON。

第 5 步:验证前三条房源
在前三条记录确认无误之前,请勿添加更多页面。将 JSON 与 Rightmove 页面上可见的房源卡片进行对比,并检查:
- 房源 ID: 应与 /properties/{id} URL 中的数字一致。
- 价格: 保留“指导价”“报价高于”等限定词以及租金计费周期。
- 地址: 确认它与价格和 URL 来自同一张卡片。
- URL: 保存绝对 URL,而不是相对路径。
- 缺失字段: 不可用的值应为空字符串。
- 重复项: 推广或重复出现的卡片不应为同一房产 ID 再创建一条记录。
数字形式的房产 ID 比地址更适合作为去重键。地址的格式可能不同,而房源 URL 通常会保留相同的 ID。
保存一条测试记录,包含日期、搜索类型、浏览器设置、请求的房源数量以及实际返回的数量。这样在 Rightmove 更改页面布局时,您就有了一个基准。

JSON 将如下所示:
第 6 步:添加单个房产详情
当搜索卡片的提取结果准确后,扩展提示词,让浏览器打开每个已保存的 URL。只要求获取项目所需的字段。
添加以下指令:
打开详情页会增加会话时长和代理流量,因此首次测试请保持小规模。如果某些字段只在特定房产类型上出现,请使用空值而不是猜测。
第 7 步:导出结果或将工作流迁移到代码
下载结构化结果,或将其传递到您批准的存储、分析或监控系统。将房产 ID 作为主记录键,这样后续运行可以更新现有房源,而不是创建重复项。
开发者可以在 Playground 中的 Playwright、Puppeteer 或 Vanilla JavaScript 模板 中重建同样的工作流。如果您已经有爬虫,可以通过 Browser API 和 CDP。会话原则保持不变,但选择器、操作、等待和输出验证仍需在您的代码中实现并测试。请参阅 Scraping Browser 指南 了解开发者路径。
如何处理 Rightmove 的分页?
分页应使用 一个粘性会话、按房源 ID 去重以及明确的停止规则。先采集并验证一页结果,然后逐步扩展提示词。
添加类似如下的指令:
source_page 字段有助于追溯被跳过或重复的记录。如果第三页返回了意外结果,您就能知道该在 Live Browser 中重放哪一步导航操作。
对于规模较大的项目,请将宽泛的搜索拆分为较小的分组。 区域、邮编、价格区间、房产类型以及销售或租赁渠道都可以作为划分边界。较小的搜索更容易恢复,也更不容易在多个结果页中重复出现同一房源。
Rightmove 的内部搜索请求可能会使用一个 index 值来表示结果偏移量。这在研究该网站的分页方式时会有帮助,但本教程中的工作流程使用的是可见的 Next 控件。这样可以让浏览器行为与 Live Browser 中显示的页面保持一致。
如何为 Rightmove 数据采集配置代理和会话
使用 为每个相互关联的搜索流程使用一个稳定的英国会话。请在相互独立的任务之间轮换,而不是在同一搜索的连续页面之间轮换。
| 工作流程 | 会话设置 | 为什么 |
| 跨多页的单次搜索 | 粘性会话 | 保留 Cookie、位置和导航状态 |
| 按城市或邮编分别搜索 | 在任务之间轮换 | 将每次搜索视为独立任务 |
| 经授权的定期监控 | 使用浏览器配置文件的粘性会话 | 复用相关 Cookie 和已保存的状态 |
| 小型开发测试 | 一个稳定的会话 | 让故障更易于检查和复现 |
从低并发和有节制的导航开始。在增加访问量之前,先在 Live Browser 中观察最初的几个会话。如果页面返回验证界面、空白卡片或意外的位置,请停止并检查浏览器状态,而不是立即重试。
代理连接、浏览器指纹、Cookie、位置设置和导航模式会一同到达目标网站。NodeMaven Scraping Browser 使用 住宅代理 和 移动代理 及其 IP 质量过滤器、位置定向、粘性会话以及一致的浏览器设置。对于英国房产搜索,这可为浏览器提供一致的英国网络和浏览器环境。
您也可以使用 NodeMaven 住宅代理 使用 Playwright, Puppeteer, Selenium以及其他 抓取工具 ,这些同样可以在 Scraping Browser 之外使用。我们的 代理轮换 指南解释了粘性连接与轮换连接分别适用于哪些采集模式。
任何代理或浏览器配置都无法保证访问每个网站,代理也不能替代目标网站的授权。
无需搭建浏览器基础设施即可运行工作流
NodeMaven 抓取浏览器 将云端浏览器、高质量 NodeMaven 代理、托管的浏览器设置、AI 提示词、代码模板、支持的 CAPTCHA 解决以及调试工具整合在一个产品中。
浏览器运行时 不收取单独的使用费 ,只要客户拥有有效的 NodeMaven 轮换住宅代理订阅。您只需为会话期间传输的轮换代理流量付费。AI 提示词、Live Browser、支持的 CAPTCHA 解决以及会话录制均已包含,不另行收费。
新客户可以先使用 $3.50 的付费试用(包含 750 MB 住宅和移动代理流量)。轮换住宅代理和移动代理套餐则起价为 每 GB 2.20 美元。请查看 NodeMaven 价格页面 了解当前费率,并查看 Scraping Browser 指南 了解当前限制。
Rightmove 有官方 API 吗?
Rightmove 提供官方的 Real Time Data Feed,但它仅面向发布和管理自有房源的授权合作伙伴。 它并不是一个可用于下载 Rightmove 房源库存的公开搜索 API。
该 Rightmove Real Time Data Feed 规范 描述了用于添加、更新和删除房源的认证调用,同时也涵盖分支机构房源列表、产品、绩效报告以及线索报告。访问需要由 Rightmove 配置的网络,以及向授权方提供的认证凭据。
由此形成了三个不同的概念:
| 选项 | 预期用途 | 主要限制 |
| Rightmove Real Time Data Feed | 管理房源的授权中介和数据提供方 | 需要 Rightmove 的授权和凭据 |
| Rightmove 内部搜索请求 | 为 Rightmove 自身网站加载数据 | 无官方文档,且随时可能变更 |
| Scraping Browser 工作流 | 从已渲染页面进行授权采集 | 需要获得许可并持续维护工作流 |
修复常见的 Rightmove 爬虫错误
大多数早期失败都源于时序、字段匹配、分页或会话配置问题。Live Browser 和会话录像可以显示自动化程序实际接收到的页面。
| 问题 | 通常发生了什么 | 需要检查的内容 |
| 结果为空 | 页面仍在加载,或预期的卡片不存在 | 查看 Live Browser 并等待房源卡片显示出来 |
| 房源重复 | 同一房源以推广卡片形式出现,或在多个页面中重复出现 | 按数字型房源 ID 去重 |
| 地址或价格错误 | 提示词匹配到了另一张卡片中的文本 | 将提取范围限制在最近的房源卡片容器内 |
| 缺少详情字段 | 该房源省略了此字段,或采用了不同的布局 | 返回空值并检查页面 |
| 验证页面或速率限制页面 | 访问条件或请求模式发生了变化 | 停止运行,并检查权限、速率、会话状态和代理位置 |
| 流量消耗过高 | 运行过程中加载了大图片、视频、广告或重复页面 | 检查浏览器操作,并仔细测试资源拦截 |
| 输出为文本而非 JSON | 输出指令过于宽松 | 定义每个字段,并要求仅输出有效的 JSON |
出现错误时,请先回放会话,再修改提示词。字段缺失和页面缺失需要不同的修复方式。控制台、截图、结构化结果和录像有助于判断发生的是哪一种情况。



