14 открытых GitHub-репозиториев для веб-скрапинга в 2026 году

Четырнадцать open-source Инструменты веб-скрейпинга которые вы можете клонировать и запустить на собственной инфраструктуре, без кредитов и оплаты за каждую страницу. Мы выгрузили количество звёзд, лицензии и даты коммитов с GitHub 19 августа 2026 года, а затем прочитали каждый README, чтобы убедиться, что проекты делают то, что заявляют.
Этот материал написан для разработчиков, которые уже знают, что такое headless-браузер. Если вы вместо этого выбираете между управляемыми платформами, их разбирает наш обзор стека для AI-скрапинга веба покрывает их.
Сразу одна оговорка, потому что она определяет, что вошло в эту статью, а что нет. Всё, что здесь описано, предполагает, что вы собираете общедоступные данные в соответствии с законом и условиями использования целевого сайта. Это реальное ограничение, а не формальность. Оно исключает часть того, что технически позволяют эти инструменты, и мы отметили, где проходит эта граница.
Раскрытие информации: NodeMaven спонсирует open-source-проекты для скрапинга, и в README каждого репозитория ниже есть блок NodeMaven. Именно поэтому мы хорошо знаем эти проекты, но не поэтому они попали в список. Отбор шёл по популярности, активности поддержки и по тому, умеет ли проект то, чего не умеют другие. Scrapling, MediaCrawler и Camoufox возглавили бы любой честный список независимо от того, кто их спонсирует.
Коротко о главном
Если вы пишете на Питон и хотите один инструмент, который закрывает большую часть задачи, берите Scrapling. Если существующий проект на Playwright начал давать сбои, Patchright — это изменение в одну строку. Если результат уходит в LLM, используйте webclaw. Если вам нужна инфраструктура, на которую смотрит вся команда, а не библиотека, которую импортирует каждый проект, посмотрите на HeadlessX или trawl.
И что бы вы ни выбрали, прокси всё равно понадобится. Эти проекты отвечают за парсинг, рендеринг и фингерпринтинг. Ни один из них не управляет IP, с которого приходит ваш запрос, а это первое, что проверяет большинство антибот-систем.
Как мы отбирали репозитории
Активно поддерживаются. В каждом репозитории ниже есть коммит за последние шесть недель. Stealth-библиотека, которая перестала обновляться в 2025 году, хуже, чем бесполезна, потому что антибот-вендоры выпускают обновления быстрее.
Решает конкретную задачу. Пять проектов из этой подборки сокращают число заблокированных запросов при автоматизации браузера, и делают это пятью разными способами. Мы оставили все пять, потому что правильный выбор зависит от того, начинаете вы с нуля или дорабатываете уже существующий стек.
Реальное использование, с одним осознанным исключением. Количество звёзд указано честно, а не так, будто у нового проекта уже есть сообщество, которого он пока не заслужил.
Все команды установки взяты из README соответствующих проектов по состоянию на 19 августа 2026 года. Перед запуском загляните в репозиторий, так как способы упаковки меняются.
Все репозитории по категориям и стеку
| Репозиторий | Категория | Stack | Звёзды | Лицензия | Нужен прокси |
|---|---|---|---|---|---|
| Scrapling | каркас | Питон | 75,066 | BSD-3-Clause | Да, ротация |
| MediaCrawler | Специализированный скрапер | Python + Playwright | 62,928 | Смотрите репозиторий | Да, закреплённые сессии |
| Obscura | Headless-движок | Rust + V8 | 21,653 | Apache-2.0 | Да |
| Camoufox | Антидетект-браузер | C++ / Python | 11,227 | MPL-2.0 | Да |
| pydoll | Автоматизация браузера | Python (CDP) | 7,029 | MIT | Да |
| google-maps-scraper | Специализированный скрапер | Иди | 5,554 | MIT | Да, с геотаргетингом |
| webclaw | Извлечение данных с помощью LLM | Rust | 2,281 | AGPL-3.0 | Зависит от ситуации |
| HeadlessX | Платформа с самостоятельным размещением | TypeScript | 2,246 | Смотрите репозиторий | Да |
| Patchright | Автоматизация | Питон | 1,469 | Apache-2.0 | Да |
| Botright | Автоматизация + CAPTCHA | Python + Playwright | 1,012 | GPL-3.0 | Да |
| trawl | Решение challenge-проверок | Bun + Elysia | 698 | AGPL-3.0 | Встроено в тариф 4-го уровня |
| GoScrapy | каркас | Иди | 363 | Смотрите репозиторий | Да, ротация |
| AutomatiQ | Генерация скриптов | Python + CDP | 165 | MIT | At runtime |
| scrapy-stealth | Плагин для Scrapy | Питон | 2 | Смотрите репозиторий | Да, встроенная ротация |
Количество звёзд и даты коммитов проверены на GitHub 19 августа 2026 года. Лицензии взяты из метаданных самих репозиториев. Четыре проекта не указывают лицензию в машиночитаемом виде, поэтому проверьте её перед коммерческим использованием.
Антидетект-браузеры и автоматизация
Пять проектов, одна задача: снизить долю неудачных запросов и ограничений по частоте при сборе данных через браузер. Различаются они тем, Где как именно они нормализуют отпечаток браузера, и именно это определяет, насколько хорошо подход держится на практике.
1. Camoufox, 11,227 ⭐
Большинство stealth-инструментов внедряют JavaScript, чтобы переопределить navigator.webdriver и подобные свойства. Само это внедрение является сигналом, поскольку анти-бот скрипты проверяют, не были ли свойства подменены. Camoufox идёт другим путём: он патчит отпечаток на уровне C++ и движка Juggler в модифицированной сборке Firefox, так что с точки зрения JavaScript обнаруживать нечего. Это самый зрелый проект в группе и точка отсчёта, с которой сравнивают остальные.
Но вы работаете на Firefox. Если ваша целевая площадка отображается иначе в Chrome или ваш инструментарий рассчитан на Chromium, это трение вы почувствуете сразу.
pip install cloverlabs-camoufoxЛучше всего подходит для: сложные цели в проекте, который вы начинаете с нуля.
2. Patchright, 1,469 ⭐
Заявка проекта необычно узкая, и именно поэтому она работает. Стандартный Playwright оставляет следы Chrome DevTools Protocol, которые системы уровня Cloudflare уверенно распознают. Patchright убирает их и не меняет больше ничего. Вы заменяете один импорт. Никакого нового API, никакого нового браузера, никакой переработки селекторов.
Он патчит слой автоматизации, а не движок браузера, поэтому против самых агрессивных целей Camoufox работает глубже. Для большинства ситуаций такой размен вполне оправдан.
pip install patchrightЛучше всего подходит для: существующий проект на Playwright, который недавно начал блокироваться. Самое малозатратное решение в этом списке.
3. pydoll, 7,029 ⭐
pydoll общается с Chrome напрямую по CDP через WebSocket. Здесь нет ни бинарника WebDriver, ни флага navigator.webdriver, потому что WebDriver в стеке отсутствует вовсе.
Отдельного места он заслуживает потому, что работает с поведенческим обнаружением, а не только с отпечатками. Движения мыши следуют кривым Безье, набор текста имеет реалистичный тайминг, у прокрутки есть физика. В README есть мысль, которую стоит повторить: отпечаток силён ровно настолько, насколько силён его самый слабый слой, поскольку анти-бот системы сопоставляют сигналы по всем слоям сразу. Безупречный user agent в паре с роботизированными движениями мыши всё равно провалится.
pip install pydoll-pythonЛучше всего подходит для: цели, которые оценивают паттерны взаимодействия, а не только заголовки.
4. Botright, 1,012 ⭐
Все остальные решения в этом разделе оставляют CAPTCHA на вас. Botright объединяет их решение и работу с отпечатками в одном пакете на базе Playwright, что убирает из вашего стека стороннюю интеграцию.
Стоит знать две вещи. Проект написан тем же автором, что и Patchright, и он активно поддерживается: последний коммит был 18 августа 2026 года, что опровергает довольно распространённое мнение, будто проект заглох. Кроме того, он под GPL-3.0, самой строгой лицензией в этом обзоре, с реальными последствиями для коммерческих продуктов. Смотрите раздел о лицензировании прежде чем строить на нём своё решение.
pip install botright
playwright installЛучше всего подходит для: процессов, где капчи становятся узким местом и лицензия GPL приемлема.
5. Obscura, 21,653 ⭐
Движок headless-браузера, написанный на Rust поверх V8 и позиционируемый как замена headless Chrome. Согласно его README, он потребляет около 30 MB оперативной памяти на экземпляр против 200 MB и более у headless Chrome, при практически мгновенном запуске. Он поддерживает CDP, поэтому клиенты Puppeteer и Playwright подключаются без каких-либо изменений.
На больших масштабах эта цифра по памяти и есть весь аргумент. Это разница между десятью одновременными браузерами на сервере и сотней. Оговорка в том, что это молодой движок, а не Chromium, поэтому на сложных сайтах стоит ожидать краевых случаев. Тестируйте его на самой проблемной для вас странице, а не на демонстрационной.
docker run -d --name obscura -p 127.0.0.1:9222:9222 h4ckf0r0day/obscura
Building from source with stealth enabled:
git clone https://github.com/h4ckf0r0day/obscura.git
cd obscura
cargo build --release -p obscura-cli --bins --features render,stealthЛучше всего подходит для: обходов с высокой параллельностью, где потолком становится память браузера.
Фреймворки для скрапинга
6. Scrapling, 75,066 ⭐
По количеству звёзд Scrapling с большим отрывом является самым популярным проектом в этом списке, и разрыв продолжает расти. Причина — самовосстанавливающиеся селекторы. Когда сайт переименовывает CSS-класс или переносит элемент, парсер находит его заново, вместо того чтобы вернуть None в два часа ночи.
Это та же возможность, за которую управляемые платформы берут плату по LLM-тарифам за страницу, только здесь это локальный парсер без единого вызова API. Загрузчики также справляются с защитой уровня Cloudflare, так что одна библиотека закрывает обе половины задачи.
pip install "scrapling[fetchers]"
scrapling install
Optional extras for AI-assisted extraction and the interactive shell:
pip install "scrapling[ai]"
pip install "scrapling[shell]"Лучше всего подходит для: практически любого проекта по скрапингу на Python. Если брать из этого списка только один репозиторий, берите этот.
7. GoScrapy, 363 ⭐
Большинство скраперов на Go пишется с нуля поверх colly или чистого net/http, и это заметно в проектах, которые перерастают свою первоначальную архитектуру. GoScrapy сохраняет архитектуру из пауков, middleware и пайплайнов, в категориях которой уже мыслят пользователи Scrapy, поэтому команде, переходящей с Python на Go, не приходится перепроектировать всю структуру проекта. Узкая потребность, но действительно плохо закрытая.
go install github.com/tech-engine/goscrapy/cmd/...@latestЛучше всего подходит для: команд на Go, которым нужна структура, и команд на Python, мигрирующих ради пропускной способности.
8. scrapy-stealth, 2 ⭐
Скажем прямо об этом проекте: две звезды, сообщества пока нет.
Он здесь, потому что закрывает пробел, который больше не закрывает ничто. Это единственный активно поддерживаемый stealth-слой, созданный специально для Scrapy, а в продакшене работает немало кода на Scrapy, который тихо сдаёт позиции современным защитам и не имеет пути к обновлению, кроме полного переписывания. Плагин добавляет имитацию браузера, ротацию прокси, смену отпечатков и логику повторных попыток под пауками, которые продолжают работать как есть. В день нашей проверки в репозитории был коммит.
pip install scrapy-stealthЛучше всего подходит для: существующей кодовой базы на Scrapy, которую вы предпочли бы не переписывать. Зафиксируйте версию и прочитайте исходный код. При таком уровне распространения вы ранний пользователь, а не клиент.
Извлечение данных для LLM- и RAG-конвейеров
9. webclaw, 2,281 ⭐
webclaw превращает веб-страницы в чистый Markdown, JSON или готовый для LLM контекст, и это самый близкий open-source аналог Firecrawl. Отличает его то, что он поставляется во всех нужных форматах: CLI, MCP-сервер, REST API и SDK для Node, Python и Go. MCP-сервер важнее, чем кажется, потому что AI-агент для написания кода может вызывать его как инструмент, не требуя никакой обёртки.
Поддержка прокси здесь полноценная, а не прикрученная сбоку. WEBCLAW_PROXY принимает одну точку подключения, WEBCLAW_PROXY_FILE — целый пул.
Лицензия AGPL-3.0. Если вы встраиваете это в размещённый коммерческий продукт, сначала прочитайте раздел о лицензировании сначала.
brew tap 0xMassi/webclaw
brew install webclaw
Разовый запуск через Docker:
docker run --rm ghcr.io/0xmassi/webclaw https://example.com
SDK:
npm install @webclaw/sdk
pip install webclaw
go get github.com/0xMassi/webclaw-goЛучше всего подходит для: загрузки данных для RAG и AI-агентов, которым нужен чистый текст с произвольных URL без счётчика кредитов.
Инфраструктура на собственном сервере
Это сервисы, на которые указывает вся ваша команда, а не библиотеки, которые каждый проект подключает отдельно. Именно поэтому они вынесены в отдельный раздел.
10. HeadlessX, 2,246 ⭐
По сути, это Browserless со встроенным анти-детектом, работающий на Camoufox. Вы поднимаете одну точку доступа, и все отправляют на неё задачи автоматизации, а очереди, логи, API-ключи и управление прокси обрабатываются централизованно.
Последний пункт оправдывает себя быстрее, чем ожидаешь. Учётные данные прокси, разбросанные по .env-файлам десятка разработчиков, именно так и оказываются в публичном репозитории.
Поскольку решение построено на Camoufox, оно наследует тот же профиль обнаружения. Если целевой сайт научился распознавать Camoufox, HeadlessX вас не спасёт.
npm install -g @headlessx-cli/core
headlessx init
headlessx status
headlessx doctorЛучше всего подходит для: командам, которым нужна общая браузерная инфраструктура вместо того, чтобы каждый запускал свою.
11. trawl, 698 ⭐
trawl решает JavaScript-задачи за ваши остальные инструменты и служит прямой заменой FlareSolverr. В README указано, что он работает в 2–6 раз быстрее, а кэш сессий на Redis возвращает повторные запросы примерно за 500 ms.
Самое интересное — четырёхуровневая эскалация. Запрос начинается как обычная HTTP-загрузка. Если он заблокирован, происходит повтор через закэшированную сессию браузера. Если блокировка сохраняется, задача решается заново. И только на четвёртом уровне запрос идёт через резидентный прокси. При большом обходе, где большинство страниц не защищены, это значит, что вы платите за дорогой трафик только на тех запросах, которым это действительно нужно.
git clone https://github.com/germondai/trawl
cd trawl
cp .env.example .env
docker compose up -dЛицензия AGPL-3.0, и в основе лежит Camoufox, поэтому оговорка о наследуемом отпечатке из HeadlessX справедлива и здесь.
Лучше всего подходит для: смешанным задачам, где часть целей защищена, а большинство — нет.
Готовые нишевые скраперы
Иногда цель — известная платформа, и нет никакого смысла что-то создавать самому.
12. MediaCrawler, 62,928 ⭐
Мультиплатформенный сборщик данных для китайских соцсетей: Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba и Zhihu. Второй по количеству звёзд проект в этом списке, что говорит о том, насколько плохо эти данные покрыты другими решениями.
Архитектурно он интересен тем, что отказывается делать. Вместо реверс-инжиниринга алгоритма подписи запросов каждой платформы, который постоянно ломается и превращается в работу на полную ставку, он напрямую управляет контекстом браузера. Медленнее на каждый запрос, но куда надёжнее.
Перед использованием прочитайте условия. Некоторые из этих платформ ограничивают автоматический сбор данных в своих условиях использования, и часть того, что позволяет MediaCrawler, выходит за рамки этих условий. Сбор публичных данных в рамках правил платформы — это нормально. Обход средств контроля доступа — нет, и в этом мы помогать не станем.
uv run uvicorn api.main:app --port 8080 --reload
cd webui && npm install && npm run devЛучше всего подходит для: исследованиям и рыночной аналитике на китайских платформах в рамках правил каждой платформы.
13. google-maps-scraper, 5,554 ⭐
Извлекает данные о компаниях из Google Maps: названия, телефоны, сайты, количество отзывов, рейтинги, координаты. Поставляется в виде CLI, веб-интерфейса и REST API, плюс Agent Skill, чтобы AI-агент мог выполнить весь процесс от начала до конца. Последнее встречается нечасто и полезно, если вы строите агентные пайплайны.
mkdir -p gmaps-output
docker run \
-v gmaps-playwright-cache:/opt \
-v "$PWD/example-queries.txt:/queries.txt:ro" \
-v "$PWD/gmaps-output:/out" \
gosom/google-maps-scraper \
-input /queries.txt
С веб-интерфейсом на порту 8080:
docker run -v "$PWD/gmapsdata:/gmapsdata" -p 8080:8080 \
gosom/google-maps-scraper -data-folder /gmapsdataРезультаты в Maps по определению зависят от геолокации, из-за чего таргетинг по местоположению становится требованием корректности, а не оптимизацией. Запрос «стоматологи в Чикаго» с IP дата-центра во Франкфурте что-то вернёт, но не то, что видит пользователь из Чикаго.
Лучше всего подходит для: исследованию локальных рынков и работе с лидами по географии.
Автоматизация и генерация скриптов
14. AutomatiQ, 165 ⭐
AutomatiQ наблюдает за тем, как вы пользуетесь сайтом, а затем восстанавливает сессию в виде самостоятельного Python-скрипта. Он записывает сетевой трафик и взаимодействия, vision-модель аннотирует каждое действие, а агент итеративно дорабатывает результат в песочнице, пока сгенерированный скрипт не заработает на реальных данных.
Полученный скрипт работает без браузера. Вы получаете исходные запросы, а не воспроизведение через Playwright, а это разница между скриптом, который тратит 2 MB на страницу, и тем, что обходится в 50 KB. На регулярной задаче этот разрыв быстро накапливается.
Это альфа-версия с 165 звёздами. Воспринимайте результат как хороший первый черновик, а не как готовый к продакшену код.
pip install automatiq
Из исходников:
git clone https://github.com/StoneSteel27/AutomatiQ.git
cd AutomatiQ
uv sync
uv run automatiq run https://example.comЛучше всего подходит для: разобраться, как на самом деле ведёт себя публичный API сайта.
Что нужно знать о лицензировании
Если вы запускаете всё это внутри компании, это мало что меняет. Если же клиенты платят за доступ к тому, что вы построили сверху, лицензия AGPL у webclaw и trawl — это та граница, к которой стоит присмотреться внимательно, а «мы запускаем это только на своих серверах» — ровно тот сценарий, ради которого AGPL и существует.
Это не юридическая консультация, и файлы лицензий меняются. Проверьте репозиторий самостоятельно, прежде чем строить на нём что-либо.

Где этим инструментам нужны прокси
Каждый проект здесь так или иначе решает задачи парсинга, рендеринга и нормализации отпечатка. Ни один из них не управляет тем, с какого IP приходит запрос, а это самая дешёвая проверка, которую может выполнить антибот-система, поэтому обычно она идёт первой. Хорошо настроенный браузер, приходящий с помеченного датацентрового IP, получит отказ ещё до того, как его отпечаток вообще будет изучен.
| Репозиторий | Нужен прокси | Тип | Почему |
|---|---|---|---|
| Camoufox, Patchright, pydoll, Botright | Да | Резидентские | Отпечаток браузера решён. А вот IP — нет. |
| Obscura | Да | Резидентские | Высокая параллельность означает большой объём запросов с одного источника. |
| Scrapling, GoScrapy, scrapy-stealth | Да | Ротационный резидентский | На уровне фреймворка объёмы быстро упираются в лимиты частоты запросов. |
| webclaw | Зависит от ситуации | Резидентские | Встроенная поддержка WEBCLAW_PROXY. Для открытых URL она может не понадобиться. |
| HeadlessX | Да | Резидентские | Централизованное управление прокси встроено — пользуйтесь им. |
| trawl | Built in | Резидентские | Четвёртый уровень модели эскалации это резидентный прокси. |
| MediaCrawler | Да | мобильные, sticky | Сбор данных на основе сессий требует стабильной идентичности на всё время сессии. |
| google-maps-scraper | Да | Резидентные, на уровне города | Результаты зависят от геолокации, поэтому точность локации — это точность данных. |
| AutomatiQ | At runtime | Резидентские | Сгенерированные скрипты обращаются к эндпоинтам напрямую, без браузера. |
Два момента, которые стоит усвоить.
Ротационные и sticky-прокси решают разные задачи. Обходу 50 000 страниц товаров нужен новый IP на каждый запрос. Рабочему процессу на основе сессий нужен один IP, удерживаемый на всё её время. Именно из-за путаницы между ними люди приходят к выводу, что прокси не работают, тогда как инструмент просто применили не к той задаче. Статические ISP-прокси занимают промежуточное положение и подходят для всего, где нужна фиксированная личность на высокой скорости.
Вы платите за трафик, а не за запросы. Отрендеренная в браузере страница с картинками и CSS весит от 1 до 3 MB. Те же данные из лежащего в основе JSON-эндпоинта займут около 50 KB. Это разница в стоимости в 20-60 раз при идентичном результате, и именно поэтому подход AutomatiQ с поиском эндпоинта оправдывает усилия в любой регулярной задаче. Наше руководство по скрапингу на Python объясняет, как находить такие эндпоинты в DevTools.
Прежде чем брать тот или иной объём трафика, измерьте, сколько на самом деле стоят ваши страницы. проверка пропускной способности справляется с этим за пару минут, и это бесплатно.





