88 звёзд на GitHub и продолжает расти. Yozh Crawler + Scraper — бесплатный, опенсорсный и создаётся публично — поставьте нам звезду, если он заслужил место в вашем стеке.
v0.1.13 · Yozh Crawler уже здесь

Простой веб-скрейпинг
для ИИ-агентов
и людей

Один опенсорсный инструмент для сбора данных и скрейпинга. Стартуйте с одного URL, обойдите сайт и получайте структурированные данные по мере загрузки страниц. Работает с MCP и инструментами вроде Claude и Cursor, с готовыми пресетами для маркетплейсов Amazon и eBay.

88 Звёзд на GitHub
MIT Лицензия · Бесплатно навсегда
v0.1.13 Последний релиз
Open Scraper Tester
Scraper URL http://localhost:8000 Check ok Crawler URL http://localhost:8001 Check ok CyberYozh API Docs ↗ Get API Key ↗
Scrape Page
Batch Scrape
Crawler
Jobs
MCP
Crawl Parameters
Seed URL *
Scope Mode
same-domain
Max Depth
3
Max Pages
47
Per-domain RPS
1.0
Per-domain
1
Include Patterns (regex, one per line)
^https://amazon\.co\.uk/dp/
Exclude Patterns (regex, one per line)
/cart|/account|/checkout
Crawl Proxy⚠ crawl proxy=none — no IP rotation
Proxy Type
none
Enable scraping (keep raw_html / screenshot / extracted data per page)
Result
crawl_________________ · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0
Crawl progress and pages will appear here...
Что нового · v0.1.13

Обходите целые сайты и получайте данные за один прогон

Yozh Crawler строит полную структуру сайта и обрабатывает страницы по мере их обнаружения. Вы получаете и охват, и готовые результаты за один прогон, без раздельных шагов обхода и скрейпинга. Работает прямо внутри ваших процессов сбора данных.

Yozh Crawler, встроенный NEW

Стартуйте с одного URL и стройте карту всего сайта. Страницы находятся и обрабатываются за один прогон, так что вы получаете полный охват без лишних шагов.

Режим обнаружения NEW

Нужны только ссылки? Переключитесь в режим обнаружения и стройте карту сайта без парсинга. Быстрее, легче и полезно для аудита и проверок структуры.

Stealth-браузер

Согласует заголовки, локацию и сигналы браузера с вашим прокси. Помогает держать сессии стабильными в разных регионах.

Пакетный скрейпинг

Запускайте сотни URL одним запросом. Обрабатывайте всё параллельно с одним чистым выводом.

Двухэтапная отмена NEW

Останавливайте задачи, не ломая результаты. Дайте активным страницам доработать или остановите всё мгновенно.

Интеграция с MCP

Подключайтесь напрямую к инструментам вроде Claude и Cursor. Используйте скрейпинг и обход как часть привычных процессов.

10 встроенных пресетов

Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — передайте имя источника и параметры, получите нормализованный ответ. Никаких селекторов писать не нужно.

LLM-самовосстановление NEW

Сайт выкатил изменение вёрстки и ваши CSS-селекторы возвращают пусто? Парсер просит LLM (OpenAI / Anthropic / Gemini / OpenRouter) перегенерировать селектор на лету. Пайплайн продолжает работать.

Пресеты, сгенерированные ИИ NEW

Нужен сайт, для которого у нас нет пресета? Опишите, что извлечь, и вставьте пример URL — POST /api/v1/presets/generate вернёт готовый JSON пресета.

Авторизованные сессии NEW

Войдите один раз через декларативный DSL (goto / fill / click / wait) или вставьте экспортированные cookies. Переиспользуйте сессию в каждом скрейпе. Обязательно для закрытых целей вроде пресета LinkedIn.

Интерфейс

Простая инфраструктура скрейпинга под вашим контролем

Настройте процесс в одном месте и запускайте его так, как нужно. Всё понятно, организованно и легко управляется без лишних инструментов.

1

Встроенные прокси, готовые к работе

Доступ к резидентским, мобильным и датацентр-прокси в 120+ странах. Более 50 миллионов IP при аптайме 99,9%. Включает поддержку фингерпринтинга для согласования устройства, браузера и сетевого поведения ради стабильных сессий и лучшего контроля.

2

Гибкое извлечение данных

Используйте CSS-селекторы, XPath или авто-определение для популярных сайтов. Получайте чистый структурированный JSON без сложной настройки.

3

Все данные в одном месте

Получайте сырой HTML, скриншоты и распарсенные данные вместе. Всё, что нужно, без переключения между инструментами.

4

Простое управление и доступ по MCP

Останавливайте задачи в любой момент одним кликом и переключайтесь между скрейпером и краулером. Ваш процесс остаётся простым и под контролем.

MCP · Model Context Protocol

ИИ-агенты, созданные для веб-скрейпинга и обхода

Подключите Yozh Crawler и Yozh Scraper к Claude, Cursor или любому MCP-клиенту. Переключайте инструменты одним тумблером, без лишнего кода.

Возможности веб-скрейпинга

Все возможности Yozh Scraper доступны как функции для вашего агента, включая скрейпинг, пакетные прогоны и скриншоты.

Минута на подключение

Скопируйте конфиг, перезапустите клиент — и готово.

Работает с любым MCP-клиентом

Claude Desktop, Cursor, Cline или кастомные агенты.

Полный контроль над набором инструментов

Выбирайте, как агент выполняет задачи — от отдельных страниц до целых пакетов.

Запускайте как удобно

Используйте локальный MCP-сервер или разверните его на своей инфраструктуре.

// ~/Library/Application Support/Claude/claude_desktop_config.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cursor → Settings → MCP → Add new MCP Server
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cline → MCP Servers → Edit cline_mcp_settings.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp",
      "disabled": false
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp",
      "disabled": false
    }
  }
}
// Anthropic Messages API · MCP via Streamable HTTP
// Note: scraper must be reachable from Anthropic's servers (deploy publicly)
import Anthropic from "@anthropic-ai/sdk";

const response = await new Anthropic().messages.create({
  model: "claude-opus-4-8",
  mcp_servers: [
    { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" },
    { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" }
  ],
  messages: [...]
});
Полный гайд по интеграции MCP
Yozh Crawler · v0.1.13

Обход, стриминг и парсинг страниц в реальном времени

Yozh Crawler стартует с одного URL, находит страницы по всему сайту и обрабатывает их по мере загрузки — вы получаете полную структуру и готовые данные за один прогон.

Стриминг в реальном времени

Страницы появляются по мере обнаружения и обработки. Подключайтесь напрямую из клиента, агента или пайплайна, не дожидаясь полного прогона.

Режим обнаружения

Нужны только ссылки? Стройте карту сайта без парсинга. Быстрее и экономичнее для проверок структуры и аудита.

Двухэтапная отмена

Безопасно останавливайте задачи. Дайте активным страницам доработать или остановите всё мгновенно, когда нужно.

Переключатель MCP-цели

Переключайтесь между скрейпером и краулером одним тумблером. Ваш агент использует правильный инструмент под каждую задачу.

Живое дерево сайта в UI

Смотрите, как структура сайта строится в реальном времени. Следите за прогрессом страница за страницей, не покидая дашборд.

Result

crawl_a8f3c124b6e0d7 · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0 · out-of-scope: 0 · retries: 0
Site Map (0 pages)

                    
URL Parent Depth Status Took
Комбо · Краулер + Скрейпер

От одного URL до полного охвата сайта

Краулер находит страницы, скрейпер их обрабатывает, а ваш ИИ-агент использует результаты — подходит и новичкам, и экспертам.

Краулер

Находит все URL

Yozh Scraper

Извлекает в JSON

ИИ-агент

Анализирует и решает

Конкурентный анализ

Отслеживайте каталоги, цены и характеристики товаров конкурентов в одном месте. Находите пробелы в своих листингах и быстрее реагируйте на изменения рынка.

Краулер JSON ИИ

Мониторинг цен

Автоматически отслеживайте изменения цен на маркетплейсах. Настройте оповещения и получайте уведомления в Telegram или Slack при изменении цен.

Пакеты Расписание Оповещения

Данные для обучения ML

Собирайте чистые структурированные датасеты из публичных источников, готовые для анализа или обучения моделей. Создано для надёжного сбора данных в масштабе.

Stealth Прокси JSON
Пресеты маркетплейсов и сайтов

Начните скрейпить сразу с готовыми пресетами

Локали, валюты, селекторы и обработка антибота — уже настроены. Выберите пресет, чтобы увидеть, что извлекается.

10 встроенных пресетов · LLM-самовосстановление при изменении вёрстки · сгенерируйте свой по примеру URL Запросить пресет →

            

Every Amazon listing, normalized

All fields below are extracted automatically — no selectors to write.

Нужен сайт, который мы ещё не покрываем?

Откройте issue на GitHub или предложите свой пресет — мы рассматриваем PR в течение недели.

Открыть issue
Прокси

Прокси, созданные для скрейпинга

Три типа, шесть конфигураций. Выбирайте по задаче, скорости и бюджету.

Мобильные 4G/5G

Настоящие мобильные устройства в сетях операторов. Наивысший уровень доверия для строгих анти-бот систем.

Приватный выделенный от $1.7/день

Личное устройство, ручная ротация IP через API

Общий от $0.9/день

Одно устройство, несколько пользователей

Подробнее о мобильных прокси
Как это работает

Каждый IP — с настоящего смартфона или LTE/5G-модема, подключённого к крупному мобильному оператору. IP используется тысячами обычных абонентов, поэтому его блокировка заблокировала бы реальных людей — именно поэтому анти-бот системы доверяют мобильным IP больше всего.

Лучше всего для
  • Управление аккаунтами в соцсетях
  • Агрессивные анти-бот цели (Cloudflare, PerimeterX)
  • Партнёрский маркетинг и проверка рекламы
  • Задачи, требующие устойчивого «человеческого» доверия
Характеристики
  • Сети 4G LTE и 5G по всему миру
  • Поддержка UDP, подключение VPN VLESS
  • Ручная ротация IP через API или ссылку в панели
  • Подстройка отпечатка ОС
  • Безлимитный трафик на большинстве тарифов

Датацентровые

Максимальная скорость, минимальная цена. 2M+ IP в дата-центрах по всему миру.

Выделенный статичный от $1.9/мес

Один IP закреплён за вами, безлимитный трафик

Общий статичный от $0.5/мес

Общий пул, бюджетный вариант для простых задач

Подробнее о датацентровых прокси
Как это работает

IP размещены в дата-центрах и не связаны с домашними или мобильными пользователями. Они дешевле и быстрее резидентных, но анти-бот системы могут распознать их как не-человеческие, поэтому используйте их там, где доверие не критично.

Лучше всего для
  • Массовый скрейпинг лояльных сайтов
  • Внутренние инструменты и нагрузочное тестирование
  • API-эндпоинты без фильтров по доверию к IP
  • Задачи, где скорость важнее маскировки
Характеристики
  • 2M+ адресов IPv4 и IPv6
  • Выделенные или общие конфигурации
  • Безлимитный трафик на выделенных тарифах
  • Поддержка протоколов HTTPS, SOCKS5
  • Самая низкая задержка из всех трёх типов
Выбрать прокси под свою задачу → Нужен вход
Этика · Без компромиссов

Этика встроена в то, как мы управляем платформой

Открытый код — это лишь отправная точка. То, как собираются данные и откуда берутся прокси, важно не меньше. Это стандарты, которым мы следуем на практике, а не заявления на странице.

Этичный сбор данных

Мы строим инструменты, а не лазейки. Yozh Scraper сделан так, чтобы легитимный скрейпинг публичных данных был надёжным — а не чтобы взламывать то, что должно оставаться закрытым.

  • Только публично доступные данные — по умолчанию никакого скрейпинга под логином
  • Встроенные лимиты частоты не дают перегрузить сервер
  • Уважение к robots.txt и sitemap по умолчанию (можно переопределить)
  • Никакого сбора или хранения ПДн — ни нами, ни по умолчанию у пользователей
  • Инструменты, помогающие соблюдать GDPR и CCPA

Прозрачная прокси-сеть

Откуда берутся резидентские IP — тест на честность для любого прокси-провайдера. Вот откуда берутся наши, прямо:

  • Opt-in сеть. Реальные пользователи дают согласие и зарабатывают на раздаче трафика
  • Отписка в один клик в любой момент, без вопросов
  • Проверяемая цепочка поставок с документированным происхождением
  • Ноль вредоносного ПО, ноль скрытых SDK — никогда
  • Мобильные IP с устройств, которыми владеем и управляем мы, а не со взломанных телефонов

Быстрая реакция на злоупотребления

Если кто-то использует нашу инфраструктуру во вред другим, мы хотим об этом знать — и среагировать, пока не стало хуже.

  • Прямая связь с живым человеком, а не очередь тикетов
  • Прозрачный процесс расследования каждого обоснованного обращения
  • Активное сотрудничество с правоохранительными органами по подтверждённым случаям
  • Публичная политика по злоупотреблениям, а не мелкий шрифт
abuse-reports@cyberyozh.com
Среднее время ответа: 45 минут

Если сценарий предполагает злоупотребление или вред, наши инструменты не для него. Ответственное использование для нас важнее роста клиентской базы.

Если сценарию нужно скрывать личность, чтобы вредить другим, наши инструменты не для этого. Точка. Мы скорее потеряем клиента, чем принцип.

Наши политики и стандарты

Понятные правила, определяющие то, как мы работаем, — от сбора данных до происхождения прокси и использования платформы. Это реальные политики, которым следует команда, а не краткие пересказы.

Нас любят data-команды и AI-разработчики

Что говорят те, кто строит на Yozh

5,0 / 5 · Отзывов: 5
GitHub
Заменили наш собственный кластер Playwright на Yozh за полдня. MCP-эндпоинт встал прямо в нашего Claude-агента — ноль связующего кода, краулер и скрейпер просто заработали.
Marcus Reinhardt Ведущий дата-инженер Northwind Analytics
X
Система пресетов — киллер-фича. Передаём имя источника и получаем чистый JSON; самовосстановление даже поймало два изменения вёрстки Amazon раньше нас.
Priya Nair Основатель ScrapeStack
Reddit
Наконец-то опенсорсный скрейпер, для которого прокси и сессии — первоклассные сущности. Гоняем его за логин-стенами партнёрских порталов — сессии живут, результаты стабильны в разных регионах.
Daniel Osei Backend-инженер Loopfeed
X
Подключил к Cursor через MCP, и теперь мой агент тянет живые веб-данные прямо посреди задачи. Стриминговый обход по SSE — именно то, чего не хватало агентным сценариям.
Elena Kovac ИИ-инженер Vektor Labs
GitHub
Ушли с платного API скрейпинга ради экономии и готовились к откату по качеству — получили обратное. Self-hosted, без оплаты за запрос, а схема вывода чище, чем та, за которую мы платили.
Sofia Almeida Инженерный менеджер Tabbly

О веб-скрейпинге, краулинге и ИИ-агентах

Блог и статьи

Все статьи
AI-агенты
Yozh MCP
AI-агенты 09/10/2026

Масштабирование RAG-систем: Очистка DOM-дерева и правильные MCP прокси для парсинга

Современные целевые сайты безжалостно отклоняют автоматизированные запросы. Вы запускаете краулер для сбора данных с товарного каталога. Система защиты моментально сканирует ваш TLS-отпечаток. Она проверяет порядок следования…

Веб-скрапинг
Сбор данных с сайтов в 2026 году: методы, инструменты и как масштабировать процесс
Yozh Scraper
Веб-скрапинг 09/07/2026

Сбор данных с сайтов в 2026 году: методы, инструменты и как масштабировать процесс

Узнайте, как устроен сбор данных с веб-сайтов, какие методы подходят для разных сайтов, какие инструменты для этого нужны и как автоматизировать надёжный сбор данных в промышленных…

Веб-скрапинг
Автоматизированный веб-скрапинг с Python: Обработка ротации мобильных IP через REST API
Yozh Scraper
Веб-скрапинг 09/04/2026

Автоматизированный веб-скрапинг с Python: Обработка ротации мобильных IP через REST API

TL;DR: Отказ от тяжёлых браузеров Браузерная автоматизация несёт колоссальные вычислительные издержки. Безголовые браузеры потребляют гигабайты оперативной памяти. Они рендерят ненужные элементы DOM-дерева. Они вызывают пиковые нагрузки…

Журнал изменений

Журнал изменений и обновления веб-скрейпинга

Yozh Scraper — опенсорсный, все обновления доступны на GitHub. Вот последние ключевые изменения.

v0.1.13 16 сентября 2026 Latest

v0.1.13

  • Row-scoped extraction. An extract rule takes a container selector; every
  • device=legacy_wap — a feature-phone identity that unlocks Google's no-JS
  • resolve_redirects — names extracted fields whose values are the page's
  • New built-in presets: ozon_search, ozon_product, mobile_de_search,
  • A warning when a search engine answered a different query than the one asked.
v0.1.12 1 сентября 2026

v0.1.12

  • Every built-in preset now ships as an explicit per-engine variant, <name>_chromium and <name>_camoufox (e.g. google_search_chromium, yandex_search_camoufox). A request names the exact variant it wants; each preset carries its own browser_engine.
  • Structured, correlated logging: business events get stable names and a request/job correlation id threaded through the scrape -> queue -> browser chain, so success/error rate and latency are answerable from logs. An opt-in JSON log shape is available via LOG_FORMAT=json (default text).
  • Browser egress policy knobs: an EGRESS_ALLOW_HOSTS allowlist (empty by default) and an EGRESS_TRANSPORT_GUARD toggle (on by default).
  • BREAKING (presets): the old single-name built-ins (google_search, google_shopping, amazon_product, amazon_search, bing_search, ebay_search, linkedin_profile, walmart_product, yandex_search, youtube_video) are replaced by their per-engine variants. A request using a bare old name now returns 404 preset_not_found; append the engine suffix (_chromium, or _camoufox for the two anti-bot targets yandex_search and walmart_product).
  • BREAKING (deploy): GET /api/v1/proxies/available and the entire /api/v2/prem-proxies/* catalog now require SERVICE_TOKEN and fail closed (503 when the token is unconfigured, 401 without it). Any consumer of these endpoints must send the X-Service-Token header; deploy the consumer first, or its calls degrade (for the proxy geo catalog, silently).
v0.1.11 25 августа 2026

v0.1.11

  • The job results response carries unreadable_slots. A job with one corrupt or schema-skewed result slot now returns its other pages (HTTP 200) and names the bad slot, instead of the whole job failing with a 500 and becoming un-cancellable until its TTL expires.
  • The login-replay page is masked with the same host-aligned WebGL/GPU, native-looking navigator, and Client-Hints (Sec-CH-UA) as the main fetch path, via a shared page-preparation helper. A credentialed login no longer submits a contradictory fingerprint (previously a macOS GPU and a HeadlessChrome Client-Hint under a Windows user agent).
  • Self-heal can no longer persist a degraded preset over a working one. It now contributes only the regenerated selector (and its dialect), keeping the preset's all / attr / post_process and required fields, and it is graded against the original contract — so a heal that returns a bare string where a coerced list belongs is no longer counted as a recovery. It also never heals from a transient 5xx error page. This closes a class of silent preset corruption.
  • Proxy credentials are kept out of logs, error messages and 502 response bodies. The SOCKS bridge, the rotating-credentials response and the username log no longer emit user:pass; a shared redactor masks proxy URLs while preserving host:port for diagnostics.
  • litellm is bounded <1.98: 1.98.0 imports NotRequired from typing unguarded and fails to import on the Python 3.10 this project targets, so a fresh install or image build would produce a container that cannot start.
v0.1.10 20 августа 2026

v0.1.10

  • Chromium WebGL now claims the host's actual GPU vendor/renderer, kept coherent with the Windows fingerprint the browser already presents, reusing the host-GPU detection from the Camoufox path (HOST_GPU_VENDOR). Without it the restored context reported a generic SwiftShader/ANGLE software-renderer string, itself an automation tell.
  • Chromium returned a null WebGL context on GPU-less / headless hosts (Chrome 136+ dropped the automatic SwiftShader fallback), and "no WebGL context at all" is a strong bot tell that real desktop Chrome never shows. A working software WebGL context is restored via --enable-unsafe-swiftshader, gated by the new SOFTWARE_WEBGL setting (default on, Chromium-only; revertible by env without a code change).
  • README now links the project site (data.cyberyozh.pro) with per-service pages for the scraper and crawler.
v0.1.0 9 июля 2026 First release

v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2

  • New required services. Browsers no longer run inside the API process. You must now run the redis and scraper-worker services (both are already in docker-compose.yml). Scale capacity with docker compose up -d --scale scraper-worker=N.
  • POST /scrape/page and /scrape/pages can now return 503 queue_full when the Redis stream depth exceeds QUEUE_MAXSIZE (previously the in-memory queue was unbounded).
  • Removed env vars (ignored, warned at startup if set): JOB_TIMEOUT_MS → use PAGE_TASK_TIMEOUT_S; JOB_RESULT_MAX → eviction is now a native Redis TTL (JOB_RESULT_TTL_S); JOBS_ENABLED → the queue is always on.
  • New env vars: REDIS_URL, PAGE_TASK_TIMEOUT_S, LOGIN_TASK_TIMEOUT_S, LOGIN_RESULT_GRACE_S, RECLAIM_IDLE_S, JOB_RESULT_TTL_S, BROWSER_MAX_PAGES, BROWSER_IDLE_SHUTDOWN_S, WARMUP_DWELL_MS.
  • The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The web-scraper container only enqueues page tasks and reads results; browsers run in separate, horizontally scalable scraper-worker containers.
Быстрый старт

Начните веб-скрейпинг за секунды

Три команды — и у вас работающий скрейпер + краулер с HTTP- и MCP-эндпоинтами.

1 Клонировать
git clone https://github.com/\
  CyberYozh-data/yozh-scraper
cd yozh-scraper
2 Запустить
cp .env.example .env
docker compose up --build
3 Скрейпить
curl -X POST localhost:8000/api/v1/scrape/page \
  -H 'Content-Type: application/json' \
  -d '{"url":"https://example.com"}'
Полная документация Подключить к Claude / Cursor через MCP →
Контакты · Поддержка

Связаться с нами

Живой человек читает всё, что приходит. Выберите удобный канал — Telegram самый быстрый.

Офис
Jurija Gagarina 231/329
Нови-Београд · Сербия
Двухуровневая поддержка, почти круглосуточно Первая линия на дежурстве почти 24/7. Сложные случаи ведут старшие инженеры.
Открытый код · Лицензия MIT · 88 ★

Готовы скрейпить?

Yozh Crawler + Scraper бесплатны. Навсегда. Поставьте звезду, если помогает — каждая звезда на счету.

Yozh Crawler + Scraper распространяются под лицензией MIT. Используйте. Форкайте. Создавайте на их основе.