Попробовать
Назад

14 открытых GitHub-репозиториев для веб-скрапинга в 2026 году

Обобщите эту статью с помощью предпочитаемого вами AI
Попробуйте наши премиум-прокси

Протестируйте наши премиум-прокси без ограничений по качеству.

  • Мобильные и резидентные прокси
  • Таргетинг на уровне ZIP
  • Статические и ротируемые IP
  • Встроенный фильтр качества
Попробовать сейчас

Четырнадцать open-source Инструменты веб-скрейпинга которые вы можете клонировать и запустить на собственной инфраструктуре, без кредитов и оплаты за каждую страницу. Мы выгрузили количество звёзд, лицензии и даты коммитов с GitHub 19 августа 2026 года, а затем прочитали каждый README, чтобы убедиться, что проекты делают то, что заявляют.

Этот материал написан для разработчиков, которые уже знают, что такое headless-браузер. Если вы вместо этого выбираете между управляемыми платформами, их разбирает наш обзор стека для AI-скрапинга веба покрывает их.

Сразу одна оговорка, потому что она определяет, что вошло в эту статью, а что нет. Всё, что здесь описано, предполагает, что вы собираете общедоступные данные в соответствии с законом и условиями использования целевого сайта. Это реальное ограничение, а не формальность. Оно исключает часть того, что технически позволяют эти инструменты, и мы отметили, где проходит эта граница.

Раскрытие информации: NodeMaven спонсирует open-source-проекты для скрапинга, и в README каждого репозитория ниже есть блок NodeMaven. Именно поэтому мы хорошо знаем эти проекты, но не поэтому они попали в список. Отбор шёл по популярности, активности поддержки и по тому, умеет ли проект то, чего не умеют другие. Scrapling, MediaCrawler и Camoufox возглавили бы любой честный список независимо от того, кто их спонсирует.

Коротко о главном

Если вы пишете на Питон и хотите один инструмент, который закрывает большую часть задачи, берите Scrapling. Если существующий проект на Playwright начал давать сбои, Patchright — это изменение в одну строку. Если результат уходит в LLM, используйте webclaw. Если вам нужна инфраструктура, на которую смотрит вся команда, а не библиотека, которую импортирует каждый проект, посмотрите на HeadlessX или trawl.

И что бы вы ни выбрали, прокси всё равно понадобится. Эти проекты отвечают за парсинг, рендеринг и фингерпринтинг. Ни один из них не управляет IP, с которого приходит ваш запрос, а это первое, что проверяет большинство антибот-систем.

Как мы отбирали репозитории

Активно поддерживаются. В каждом репозитории ниже есть коммит за последние шесть недель. Stealth-библиотека, которая перестала обновляться в 2025 году, хуже, чем бесполезна, потому что антибот-вендоры выпускают обновления быстрее.

Решает конкретную задачу. Пять проектов из этой подборки сокращают число заблокированных запросов при автоматизации браузера, и делают это пятью разными способами. Мы оставили все пять, потому что правильный выбор зависит от того, начинаете вы с нуля или дорабатываете уже существующий стек.

Реальное использование, с одним осознанным исключением. Количество звёзд указано честно, а не так, будто у нового проекта уже есть сообщество, которого он пока не заслужил.

Все команды установки взяты из README соответствующих проектов по состоянию на 19 августа 2026 года. Перед запуском загляните в репозиторий, так как способы упаковки меняются.

Все репозитории по категориям и стеку

РепозиторийКатегорияStackЗвёздыЛицензияНужен прокси
ScraplingкаркасПитон75,066BSD-3-ClauseДа, ротация
MediaCrawlerСпециализированный скраперPython + Playwright62,928Смотрите репозиторийДа, закреплённые сессии
ObscuraHeadless-движокRust + V821,653Apache-2.0Да
CamoufoxАнтидетект-браузерC++ / Python11,227MPL-2.0Да
pydollАвтоматизация браузераPython (CDP)7,029MITДа
google-maps-scraperСпециализированный скраперИди5,554MITДа, с геотаргетингом
webclawИзвлечение данных с помощью LLMRust2,281AGPL-3.0Зависит от ситуации
HeadlessXПлатформа с самостоятельным размещениемTypeScript2,246Смотрите репозиторийДа
PatchrightАвтоматизацияПитон1,469Apache-2.0Да
BotrightАвтоматизация + CAPTCHAPython + Playwright1,012GPL-3.0Да
trawlРешение challenge-проверокBun + Elysia698AGPL-3.0Встроено в тариф 4-го уровня
GoScrapyкаркасИди363Смотрите репозиторийДа, ротация
AutomatiQГенерация скриптовPython + CDP165MITAt runtime
scrapy-stealthПлагин для ScrapyПитон2Смотрите репозиторийДа, встроенная ротация

Количество звёзд и даты коммитов проверены на GitHub 19 августа 2026 года. Лицензии взяты из метаданных самих репозиториев. Четыре проекта не указывают лицензию в машиночитаемом виде, поэтому проверьте её перед коммерческим использованием.

Антидетект-браузеры и автоматизация

Пять проектов, одна задача: снизить долю неудачных запросов и ограничений по частоте при сборе данных через браузер. Различаются они тем, Где как именно они нормализуют отпечаток браузера, и именно это определяет, насколько хорошо подход держится на практике.

1. Camoufox, 11,227 ⭐

Большинство stealth-инструментов внедряют JavaScript, чтобы переопределить navigator.webdriver и подобные свойства. Само это внедрение является сигналом, поскольку анти-бот скрипты проверяют, не были ли свойства подменены. Camoufox идёт другим путём: он патчит отпечаток на уровне C++ и движка Juggler в модифицированной сборке Firefox, так что с точки зрения JavaScript обнаруживать нечего. Это самый зрелый проект в группе и точка отсчёта, с которой сравнивают остальные.

Но вы работаете на Firefox. Если ваша целевая площадка отображается иначе в Chrome или ваш инструментарий рассчитан на Chromium, это трение вы почувствуете сразу.

pip install cloverlabs-camoufox

Лучше всего подходит для: сложные цели в проекте, который вы начинаете с нуля.

2. Patchright, 1,469 ⭐

Заявка проекта необычно узкая, и именно поэтому она работает. Стандартный Playwright оставляет следы Chrome DevTools Protocol, которые системы уровня Cloudflare уверенно распознают. Patchright убирает их и не меняет больше ничего. Вы заменяете один импорт. Никакого нового API, никакого нового браузера, никакой переработки селекторов.

Он патчит слой автоматизации, а не движок браузера, поэтому против самых агрессивных целей Camoufox работает глубже. Для большинства ситуаций такой размен вполне оправдан.

pip install patchright

Лучше всего подходит для: существующий проект на Playwright, который недавно начал блокироваться. Самое малозатратное решение в этом списке.

3. pydoll, 7,029 ⭐

pydoll общается с Chrome напрямую по CDP через WebSocket. Здесь нет ни бинарника WebDriver, ни флага navigator.webdriver, потому что WebDriver в стеке отсутствует вовсе.

Отдельного места он заслуживает потому, что работает с поведенческим обнаружением, а не только с отпечатками. Движения мыши следуют кривым Безье, набор текста имеет реалистичный тайминг, у прокрутки есть физика. В README есть мысль, которую стоит повторить: отпечаток силён ровно настолько, насколько силён его самый слабый слой, поскольку анти-бот системы сопоставляют сигналы по всем слоям сразу. Безупречный user agent в паре с роботизированными движениями мыши всё равно провалится.

pip install pydoll-python

Лучше всего подходит для: цели, которые оценивают паттерны взаимодействия, а не только заголовки.

4. Botright, 1,012 ⭐

Все остальные решения в этом разделе оставляют CAPTCHA на вас. Botright объединяет их решение и работу с отпечатками в одном пакете на базе Playwright, что убирает из вашего стека стороннюю интеграцию.

Стоит знать две вещи. Проект написан тем же автором, что и Patchright, и он активно поддерживается: последний коммит был 18 августа 2026 года, что опровергает довольно распространённое мнение, будто проект заглох. Кроме того, он под GPL-3.0, самой строгой лицензией в этом обзоре, с реальными последствиями для коммерческих продуктов. Смотрите раздел о лицензировании прежде чем строить на нём своё решение.

pip install botright

playwright install

Лучше всего подходит для: процессов, где капчи становятся узким местом и лицензия GPL приемлема.

5. Obscura, 21,653 ⭐

Движок headless-браузера, написанный на Rust поверх V8 и позиционируемый как замена headless Chrome. Согласно его README, он потребляет около 30 MB оперативной памяти на экземпляр против 200 MB и более у headless Chrome, при практически мгновенном запуске. Он поддерживает CDP, поэтому клиенты Puppeteer и Playwright подключаются без каких-либо изменений.

На больших масштабах эта цифра по памяти и есть весь аргумент. Это разница между десятью одновременными браузерами на сервере и сотней. Оговорка в том, что это молодой движок, а не Chromium, поэтому на сложных сайтах стоит ожидать краевых случаев. Тестируйте его на самой проблемной для вас странице, а не на демонстрационной.

docker run -d --name obscura -p 127.0.0.1:9222:9222 h4ckf0r0day/obscura

Building from source with stealth enabled:

git clone https://github.com/h4ckf0r0day/obscura.git

cd obscura

cargo build --release -p obscura-cli --bins --features render,stealth

Лучше всего подходит для: обходов с высокой параллельностью, где потолком становится память браузера.

Фреймворки для скрапинга

6. Scrapling, 75,066 ⭐

По количеству звёзд Scrapling с большим отрывом является самым популярным проектом в этом списке, и разрыв продолжает расти. Причина — самовосстанавливающиеся селекторы. Когда сайт переименовывает CSS-класс или переносит элемент, парсер находит его заново, вместо того чтобы вернуть None в два часа ночи.

Это та же возможность, за которую управляемые платформы берут плату по LLM-тарифам за страницу, только здесь это локальный парсер без единого вызова API. Загрузчики также справляются с защитой уровня Cloudflare, так что одна библиотека закрывает обе половины задачи.

pip install "scrapling[fetchers]"

scrapling install

Optional extras for AI-assisted extraction and the interactive shell:

pip install "scrapling[ai]"

pip install "scrapling[shell]"

Лучше всего подходит для: практически любого проекта по скрапингу на Python. Если брать из этого списка только один репозиторий, берите этот.

7. GoScrapy, 363 ⭐

Большинство скраперов на Go пишется с нуля поверх colly или чистого net/http, и это заметно в проектах, которые перерастают свою первоначальную архитектуру. GoScrapy сохраняет архитектуру из пауков, middleware и пайплайнов, в категориях которой уже мыслят пользователи Scrapy, поэтому команде, переходящей с Python на Go, не приходится перепроектировать всю структуру проекта. Узкая потребность, но действительно плохо закрытая.

go install github.com/tech-engine/goscrapy/cmd/...@latest

Лучше всего подходит для: команд на Go, которым нужна структура, и команд на Python, мигрирующих ради пропускной способности.

8. scrapy-stealth, 2 ⭐

Скажем прямо об этом проекте: две звезды, сообщества пока нет.

Он здесь, потому что закрывает пробел, который больше не закрывает ничто. Это единственный активно поддерживаемый stealth-слой, созданный специально для Scrapy, а в продакшене работает немало кода на Scrapy, который тихо сдаёт позиции современным защитам и не имеет пути к обновлению, кроме полного переписывания. Плагин добавляет имитацию браузера, ротацию прокси, смену отпечатков и логику повторных попыток под пауками, которые продолжают работать как есть. В день нашей проверки в репозитории был коммит.

pip install scrapy-stealth

Лучше всего подходит для: существующей кодовой базы на Scrapy, которую вы предпочли бы не переписывать. Зафиксируйте версию и прочитайте исходный код. При таком уровне распространения вы ранний пользователь, а не клиент.

Что делать дальше

Если вы собираете что-то из перечисленного, наши резидентные IP проходят фильтр качества, прежде чем попасть в пул, и именно это удерживает высокий процент успешных запросов на тех целях, которые действительно сопротивляются. Начните с пробной версии $3.50 и протестируйте его на своей самой проблемной странице, прежде чем на что-то полагаться.

Извлечение данных для LLM- и RAG-конвейеров

9. webclaw, 2,281 ⭐

webclaw превращает веб-страницы в чистый Markdown, JSON или готовый для LLM контекст, и это самый близкий open-source аналог Firecrawl. Отличает его то, что он поставляется во всех нужных форматах: CLI, MCP-сервер, REST API и SDK для Node, Python и Go. MCP-сервер важнее, чем кажется, потому что AI-агент для написания кода может вызывать его как инструмент, не требуя никакой обёртки.

Поддержка прокси здесь полноценная, а не прикрученная сбоку. WEBCLAW_PROXY принимает одну точку подключения, WEBCLAW_PROXY_FILE — целый пул.

Лицензия AGPL-3.0. Если вы встраиваете это в размещённый коммерческий продукт, сначала прочитайте раздел о лицензировании сначала.

brew tap 0xMassi/webclaw

brew install webclaw

Разовый запуск через Docker:

docker run --rm ghcr.io/0xmassi/webclaw https://example.com

SDK:

npm install @webclaw/sdk

pip install webclaw

go get github.com/0xMassi/webclaw-go

Лучше всего подходит для: загрузки данных для RAG и AI-агентов, которым нужен чистый текст с произвольных URL без счётчика кредитов.

Инфраструктура на собственном сервере

Это сервисы, на которые указывает вся ваша команда, а не библиотеки, которые каждый проект подключает отдельно. Именно поэтому они вынесены в отдельный раздел.

10. HeadlessX, 2,246 ⭐

По сути, это Browserless со встроенным анти-детектом, работающий на Camoufox. Вы поднимаете одну точку доступа, и все отправляют на неё задачи автоматизации, а очереди, логи, API-ключи и управление прокси обрабатываются централизованно.

Последний пункт оправдывает себя быстрее, чем ожидаешь. Учётные данные прокси, разбросанные по .env-файлам десятка разработчиков, именно так и оказываются в публичном репозитории.

Поскольку решение построено на Camoufox, оно наследует тот же профиль обнаружения. Если целевой сайт научился распознавать Camoufox, HeadlessX вас не спасёт.

npm install -g @headlessx-cli/core

headlessx init

headlessx status

headlessx doctor

Лучше всего подходит для: командам, которым нужна общая браузерная инфраструктура вместо того, чтобы каждый запускал свою.

11. trawl, 698 ⭐

trawl решает JavaScript-задачи за ваши остальные инструменты и служит прямой заменой FlareSolverr. В README указано, что он работает в 2–6 раз быстрее, а кэш сессий на Redis возвращает повторные запросы примерно за 500 ms.

Самое интересное — четырёхуровневая эскалация. Запрос начинается как обычная HTTP-загрузка. Если он заблокирован, происходит повтор через закэшированную сессию браузера. Если блокировка сохраняется, задача решается заново. И только на четвёртом уровне запрос идёт через резидентный прокси. При большом обходе, где большинство страниц не защищены, это значит, что вы платите за дорогой трафик только на тех запросах, которым это действительно нужно.

git clone https://github.com/germondai/trawl

cd trawl

cp .env.example .env

docker compose up -d

Лицензия AGPL-3.0, и в основе лежит Camoufox, поэтому оговорка о наследуемом отпечатке из HeadlessX справедлива и здесь.

Лучше всего подходит для: смешанным задачам, где часть целей защищена, а большинство — нет.

Готовые нишевые скраперы

Иногда цель — известная платформа, и нет никакого смысла что-то создавать самому.

12. MediaCrawler, 62,928 ⭐

Мультиплатформенный сборщик данных для китайских соцсетей: Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba и Zhihu. Второй по количеству звёзд проект в этом списке, что говорит о том, насколько плохо эти данные покрыты другими решениями.

Архитектурно он интересен тем, что отказывается делать. Вместо реверс-инжиниринга алгоритма подписи запросов каждой платформы, который постоянно ломается и превращается в работу на полную ставку, он напрямую управляет контекстом браузера. Медленнее на каждый запрос, но куда надёжнее.

Перед использованием прочитайте условия. Некоторые из этих платформ ограничивают автоматический сбор данных в своих условиях использования, и часть того, что позволяет MediaCrawler, выходит за рамки этих условий. Сбор публичных данных в рамках правил платформы — это нормально. Обход средств контроля доступа — нет, и в этом мы помогать не станем.

uv run uvicorn api.main:app --port 8080 --reload

cd webui && npm install && npm run dev

Лучше всего подходит для: исследованиям и рыночной аналитике на китайских платформах в рамках правил каждой платформы.

13. google-maps-scraper, 5,554 ⭐

Извлекает данные о компаниях из Google Maps: названия, телефоны, сайты, количество отзывов, рейтинги, координаты. Поставляется в виде CLI, веб-интерфейса и REST API, плюс Agent Skill, чтобы AI-агент мог выполнить весь процесс от начала до конца. Последнее встречается нечасто и полезно, если вы строите агентные пайплайны.

mkdir -p gmaps-output

docker run \

  -v gmaps-playwright-cache:/opt \

  -v "$PWD/example-queries.txt:/queries.txt:ro" \

  -v "$PWD/gmaps-output:/out" \

  gosom/google-maps-scraper \

  -input /queries.txt

С веб-интерфейсом на порту 8080:

docker run -v "$PWD/gmapsdata:/gmapsdata" -p 8080:8080 \

  gosom/google-maps-scraper -data-folder /gmapsdata

Результаты в Maps по определению зависят от геолокации, из-за чего таргетинг по местоположению становится требованием корректности, а не оптимизацией. Запрос «стоматологи в Чикаго» с IP дата-центра во Франкфурте что-то вернёт, но не то, что видит пользователь из Чикаго.

Лучше всего подходит для: исследованию локальных рынков и работе с лидами по географии.

Автоматизация и генерация скриптов

14. AutomatiQ, 165 ⭐

AutomatiQ наблюдает за тем, как вы пользуетесь сайтом, а затем восстанавливает сессию в виде самостоятельного Python-скрипта. Он записывает сетевой трафик и взаимодействия, vision-модель аннотирует каждое действие, а агент итеративно дорабатывает результат в песочнице, пока сгенерированный скрипт не заработает на реальных данных.

Полученный скрипт работает без браузера. Вы получаете исходные запросы, а не воспроизведение через Playwright, а это разница между скриптом, который тратит 2 MB на страницу, и тем, что обходится в 50 KB. На регулярной задаче этот разрыв быстро накапливается.

Это альфа-версия с 165 звёздами. Воспринимайте результат как хороший первый черновик, а не как готовый к продакшену код.

pip install automatiq

Из исходников:

git clone https://github.com/StoneSteel27/AutomatiQ.git

cd AutomatiQ

uv sync

uv run automatiq run https://example.com

Лучше всего подходит для: разобраться, как на самом деле ведёт себя публичный API сайта.

Что нужно знать о лицензировании

Если вы запускаете всё это внутри компании, это мало что меняет. Если же клиенты платят за доступ к тому, что вы построили сверху, лицензия AGPL у webclaw и trawl — это та граница, к которой стоит присмотреться внимательно, а «мы запускаем это только на своих серверах» — ровно тот сценарий, ради которого AGPL и существует.

Это не юридическая консультация, и файлы лицензий меняются. Проверьте репозиторий самостоятельно, прежде чем строить на нём что-либо.

скрапинг таблицы лицензий на GitHub

Где этим инструментам нужны прокси

Каждый проект здесь так или иначе решает задачи парсинга, рендеринга и нормализации отпечатка. Ни один из них не управляет тем, с какого IP приходит запрос, а это самая дешёвая проверка, которую может выполнить антибот-система, поэтому обычно она идёт первой. Хорошо настроенный браузер, приходящий с помеченного датацентрового IP, получит отказ ещё до того, как его отпечаток вообще будет изучен.

РепозиторийНужен проксиТипПочему
Camoufox, Patchright, pydoll, BotrightДаРезидентскиеОтпечаток браузера решён. А вот IP — нет.
ObscuraДаРезидентскиеВысокая параллельность означает большой объём запросов с одного источника.
Scrapling, GoScrapy, scrapy-stealthДаРотационный резидентскийНа уровне фреймворка объёмы быстро упираются в лимиты частоты запросов.
webclawЗависит от ситуацииРезидентскиеВстроенная поддержка WEBCLAW_PROXY. Для открытых URL она может не понадобиться.
HeadlessXДаРезидентскиеЦентрализованное управление прокси встроено — пользуйтесь им.
trawlBuilt inРезидентскиеЧетвёртый уровень модели эскалации это резидентный прокси.
MediaCrawlerДамобильные, stickyСбор данных на основе сессий требует стабильной идентичности на всё время сессии.
google-maps-scraperДаРезидентные, на уровне городаРезультаты зависят от геолокации, поэтому точность локации — это точность данных.
AutomatiQAt runtimeРезидентскиеСгенерированные скрипты обращаются к эндпоинтам напрямую, без браузера.

Два момента, которые стоит усвоить.

Ротационные и sticky-прокси решают разные задачи. Обходу 50 000 страниц товаров нужен новый IP на каждый запрос. Рабочему процессу на основе сессий нужен один IP, удерживаемый на всё её время. Именно из-за путаницы между ними люди приходят к выводу, что прокси не работают, тогда как инструмент просто применили не к той задаче. Статические ISP-прокси занимают промежуточное положение и подходят для всего, где нужна фиксированная личность на высокой скорости.

Вы платите за трафик, а не за запросы. Отрендеренная в браузере страница с картинками и CSS весит от 1 до 3 MB. Те же данные из лежащего в основе JSON-эндпоинта займут около 50 KB. Это разница в стоимости в 20-60 раз при идентичном результате, и именно поэтому подход AutomatiQ с поиском эндпоинта оправдывает усилия в любой регулярной задаче. Наше руководство по скрапингу на Python объясняет, как находить такие эндпоинты в DevTools.

Прежде чем брать тот или иной объём трафика, измерьте, сколько на самом деле стоят ваши страницы. проверка пропускной способности справляется с этим за пару минут, и это бесплатно.

Обычно да, когда объёмы становятся реальными, хотя и не по той причине, которую ожидают. Экономия не на извлечении данных. Дело в том, что управляемые платформы тарифицируют в кредитах, и один запрос редко стоит один кредит. Рендеринг JavaScript и stealth-режимы идут с множителями, поэтому заявленное в тарифе число кредитов может обернуться куда меньшим количеством реально доступных запросов. Запуск open-source экстрактора на прокси с оплатой за трафик убирает множитель полностью. Взамен вы берёте на себя поддержку: повторные попытки, масштабирование и отслеживание изменений на целевых сайтах.

Да, практически в любом случае. Stealth-функции определяют, как выглядит ваш браузер. Прокси определяет, откуда приходит запрос. Антибот-системы проверяют и то, и другое, причём IP проверяют первым, потому что это дешевле. Помеченный датацентровый IP не проходит проверку ещё до того, как отпечаток будет изучен.

Scrapling, если вы пишете на Python и хотите широкое покрытие одним инструментом. Patchright, если у вас есть проект на Playwright, который недавно начал давать сбои, и вы хотите минимально возможное изменение. webclaw, если результат уходит в LLM.

Это зависит от лицензии, и для этих четырнадцати проектов ответ разный. С проектами под MIT, BSD и Apache всё просто. Проекты под AGPL, webclaw и trawl, требуют серьёзного обдумывания, если вы предлагаете хостируемый сервис, потому что сетевая оговорка приравнивает это к распространению. Четыре репозитория вообще не указывают лицензию, что формально не даёт никаких прав. Таблица лицензий содержит полный разбор.

Звёзды, лицензии и даты коммитов были считаны с GitHub 19 августа 2026 года. Open source развивается быстро, и проект, который сегодня выглядит живым, за квартал может затихнуть. Проверяйте дату последнего коммита, прежде чем строить на любом из них что-то важное.

Вам также могут понравиться эти статьи

Этот сайт использует Файлы cookie чтобы улучшить ваш опыт. Продолжая, вы соглашаетесь на использование файлов cookie.