84 звёзд на GitHub и продолжает расти. Yozh Crawler + Scraper — бесплатный, опенсорсный и создаётся публично — поставьте нам звезду, если он заслужил место в вашем стеке.
v0.1.8 · Yozh Crawler уже здесь

Простой веб-скрейпинг
для ИИ-агентов
и людей

Один опенсорсный инструмент для сбора данных и скрейпинга. Стартуйте с одного URL, обойдите сайт и получайте структурированные данные по мере загрузки страниц. Работает с MCP и инструментами вроде Claude и Cursor, с готовыми пресетами для маркетплейсов Amazon и eBay.

84 Звёзд на GitHub
MIT Лицензия · Бесплатно навсегда
v0.1.8 Последний релиз
Open Scraper Tester
Scraper URL http://localhost:8000 Check ok Crawler URL http://localhost:8001 Check ok CyberYozh API Docs ↗ Get API Key ↗
Scrape Page
Batch Scrape
Crawler
Jobs
MCP
Crawl Parameters
Seed URL *
Scope Mode
same-domain
Max Depth
3
Max Pages
47
Per-domain RPS
1.0
Per-domain
1
Include Patterns (regex, one per line)
^https://amazon\.co\.uk/dp/
Exclude Patterns (regex, one per line)
/cart|/account|/checkout
Crawl Proxy⚠ crawl proxy=none — no IP rotation
Proxy Type
none
Enable scraping (keep raw_html / screenshot / extracted data per page)
Result
crawl_________________ · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0
Crawl progress and pages will appear here...
Что нового · v0.1.8

Обходите целые сайты и получайте данные за один прогон

Yozh Crawler строит полную структуру сайта и обрабатывает страницы по мере их обнаружения. Вы получаете и охват, и готовые результаты за один прогон, без раздельных шагов обхода и скрейпинга. Работает прямо внутри ваших процессов сбора данных.

Yozh Crawler, встроенный NEW

Стартуйте с одного URL и стройте карту всего сайта. Страницы находятся и обрабатываются за один прогон, так что вы получаете полный охват без лишних шагов.

Режим обнаружения NEW

Нужны только ссылки? Переключитесь в режим обнаружения и стройте карту сайта без парсинга. Быстрее, легче и полезно для аудита и проверок структуры.

Stealth-браузер

Согласует заголовки, локацию и сигналы браузера с вашим прокси. Помогает держать сессии стабильными в разных регионах.

Пакетный скрейпинг

Запускайте сотни URL одним запросом. Обрабатывайте всё параллельно с одним чистым выводом.

Двухэтапная отмена NEW

Останавливайте задачи, не ломая результаты. Дайте активным страницам доработать или остановите всё мгновенно.

Интеграция с MCP

Подключайтесь напрямую к инструментам вроде Claude и Cursor. Используйте скрейпинг и обход как часть привычных процессов.

10 встроенных пресетов

Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — передайте имя источника и параметры, получите нормализованный ответ. Никаких селекторов писать не нужно.

LLM-самовосстановление NEW

Сайт выкатил изменение вёрстки и ваши CSS-селекторы возвращают пусто? Парсер просит LLM (OpenAI / Anthropic / Gemini / OpenRouter) перегенерировать селектор на лету. Пайплайн продолжает работать.

Пресеты, сгенерированные ИИ NEW

Нужен сайт, для которого у нас нет пресета? Опишите, что извлечь, и вставьте пример URL — POST /api/v1/presets/generate вернёт готовый JSON пресета.

Авторизованные сессии NEW

Войдите один раз через декларативный DSL (goto / fill / click / wait) или вставьте экспортированные cookies. Переиспользуйте сессию в каждом скрейпе. Обязательно для закрытых целей вроде пресета LinkedIn.

Интерфейс

Простая инфраструктура скрейпинга под вашим контролем

Настройте процесс в одном месте и запускайте его так, как нужно. Всё понятно, организованно и легко управляется без лишних инструментов.

1

Встроенные прокси, готовые к работе

Доступ к резидентским, мобильным и датацентр-прокси в 120+ странах. Более 50 миллионов IP при аптайме 99,9%. Включает поддержку фингерпринтинга для согласования устройства, браузера и сетевого поведения ради стабильных сессий и лучшего контроля.

2

Гибкое извлечение данных

Используйте CSS-селекторы, XPath или авто-определение для популярных сайтов. Получайте чистый структурированный JSON без сложной настройки.

3

Все данные в одном месте

Получайте сырой HTML, скриншоты и распарсенные данные вместе. Всё, что нужно, без переключения между инструментами.

4

Простое управление и доступ по MCP

Останавливайте задачи в любой момент одним кликом и переключайтесь между скрейпером и краулером. Ваш процесс остаётся простым и под контролем.

MCP · Model Context Protocol

ИИ-агенты, созданные для веб-скрейпинга и обхода

Подключите Yozh Crawler и Yozh Scraper к Claude, Cursor или любому MCP-клиенту. Переключайте инструменты одним тумблером, без лишнего кода.

Возможности веб-скрейпинга

Все возможности Yozh Scraper доступны как функции для вашего агента, включая скрейпинг, пакетные прогоны и скриншоты.

Минута на подключение

Скопируйте конфиг, перезапустите клиент — и готово.

Работает с любым MCP-клиентом

Claude Desktop, Cursor, Cline или кастомные агенты.

Полный контроль над набором инструментов

Выбирайте, как агент выполняет задачи — от отдельных страниц до целых пакетов.

Запускайте как удобно

Используйте локальный MCP-сервер или разверните его на своей инфраструктуре.

// ~/Library/Application Support/Claude/claude_desktop_config.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cursor → Settings → MCP → Add new MCP Server
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cline → MCP Servers → Edit cline_mcp_settings.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp",
      "disabled": false
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp",
      "disabled": false
    }
  }
}
// Anthropic Messages API · MCP via Streamable HTTP
// Note: scraper must be reachable from Anthropic's servers (deploy publicly)
import Anthropic from "@anthropic-ai/sdk";

const response = await new Anthropic().messages.create({
  model: "claude-opus-4-8",
  mcp_servers: [
    { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" },
    { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" }
  ],
  messages: [...]
});
Полный гайд по интеграции MCP
Yozh Crawler · v0.1.8

Обход, стриминг и парсинг страниц в реальном времени

Yozh Crawler стартует с одного URL, находит страницы по всему сайту и обрабатывает их по мере загрузки — вы получаете полную структуру и готовые данные за один прогон.

Стриминг в реальном времени

Страницы появляются по мере обнаружения и обработки. Подключайтесь напрямую из клиента, агента или пайплайна, не дожидаясь полного прогона.

Режим обнаружения

Нужны только ссылки? Стройте карту сайта без парсинга. Быстрее и экономичнее для проверок структуры и аудита.

Двухэтапная отмена

Безопасно останавливайте задачи. Дайте активным страницам доработать или остановите всё мгновенно, когда нужно.

Переключатель MCP-цели

Переключайтесь между скрейпером и краулером одним тумблером. Ваш агент использует правильный инструмент под каждую задачу.

Живое дерево сайта в UI

Смотрите, как структура сайта строится в реальном времени. Следите за прогрессом страница за страницей, не покидая дашборд.

Result

crawl_a8f3c124b6e0d7 · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0 · out-of-scope: 0 · retries: 0
Site Map (0 pages)

                    
URL Parent Depth Status Took
Комбо · Краулер + Скрейпер

От одного URL до полного охвата сайта

Краулер находит страницы, скрейпер их обрабатывает, а ваш ИИ-агент использует результаты — подходит и новичкам, и экспертам.

Краулер

Находит все URL

Yozh Scraper

Извлекает в JSON

ИИ-агент

Анализирует и решает

Конкурентный анализ

Отслеживайте каталоги, цены и характеристики товаров конкурентов в одном месте. Находите пробелы в своих листингах и быстрее реагируйте на изменения рынка.

Краулер JSON ИИ

Мониторинг цен

Автоматически отслеживайте изменения цен на маркетплейсах. Настройте оповещения и получайте уведомления в Telegram или Slack при изменении цен.

Пакеты Расписание Оповещения

Данные для обучения ML

Собирайте чистые структурированные датасеты из публичных источников, готовые для анализа или обучения моделей. Создано для надёжного сбора данных в масштабе.

Stealth Прокси JSON
Пресеты маркетплейсов и сайтов

Начните скрейпить сразу с готовыми пресетами

Локали, валюты, селекторы и обработка антибота — уже настроены. Выберите пресет, чтобы увидеть, что извлекается.

10 встроенных пресетов · LLM-самовосстановление при изменении вёрстки · сгенерируйте свой по примеру URL Запросить пресет →

            

Every Amazon listing, normalized

All fields below are extracted automatically — no selectors to write.

Нужен сайт, который мы ещё не покрываем?

Откройте issue на GitHub или предложите свой пресет — мы рассматриваем PR в течение недели.

Открыть issue
Прокси

Прокси, созданные для скрейпинга

Три типа, шесть конфигураций. Выбирайте по задаче, скорости и бюджету.

Мобильные 4G/5G

Настоящие мобильные устройства в сетях операторов. Наивысший уровень доверия для строгих анти-бот систем.

Приватный выделенный from $1.7/day

Личное устройство, ручная ротация IP через API

Общий from $0.9/day

Одно устройство, несколько пользователей

Подробнее о мобильных прокси
Как это работает

Каждый IP — с настоящего смартфона или LTE/5G-модема, подключённого к крупному мобильному оператору. IP используется тысячами обычных абонентов, поэтому его блокировка заблокировала бы реальных людей — именно поэтому анти-бот системы доверяют мобильным IP больше всего.

Лучше всего для
  • Управление аккаунтами в соцсетях
  • Агрессивные анти-бот цели (Cloudflare, PerimeterX)
  • Партнёрский маркетинг и проверка рекламы
  • Задачи, требующие устойчивого «человеческого» доверия
Характеристики
  • Сети 4G LTE и 5G по всему миру
  • Поддержка UDP, подключение VPN VLS
  • Ручная ротация IP через API или ссылку в панели
  • Подстройка отпечатка ОС
  • Безлимитный трафик на большинстве тарифов

Датацентровые

Максимальная скорость, минимальная цена. 2M+ IP в дата-центрах по всему миру.

Выделенный статичный from $1.9/mo

Один IP закреплён за вами, безлимитный трафик

Общий статичный from $0.5/mo

Общий пул, бюджетный вариант для простых задач

Подробнее о датацентровых прокси
Как это работает

IP размещены в дата-центрах и не связаны с домашними или мобильными пользователями. Они дешевле и быстрее резидентных, но анти-бот системы могут распознать их как не-человеческие, поэтому используйте их там, где доверие не критично.

Лучше всего для
  • Массовый скрейпинг лояльных сайтов
  • Внутренние инструменты и нагрузочное тестирование
  • API-эндпоинты без фильтров по доверию к IP
  • Задачи, где скорость важнее маскировки
Характеристики
  • 2M+ адресов IPv4 и IPv6
  • Выделенные или общие конфигурации
  • Безлимитный трафик на выделенных тарифах
  • Поддержка протоколов HTTPS, SOCKS5
  • Самая низкая задержка из всех трёх типов
Выбрать прокси под свою задачу → Нужен вход
Этика · Без компромиссов

Этика встроена в то, как мы управляем платформой

Открытый код — это лишь отправная точка. То, как собираются данные и откуда берутся прокси, важно не меньше. Это стандарты, которым мы следуем на практике, а не заявления на странице.

Этичный сбор данных

Мы строим инструменты, а не лазейки. Yozh Scraper сделан так, чтобы легитимный скрейпинг публичных данных был надёжным — а не чтобы взламывать то, что должно оставаться закрытым.

  • Только публично доступные данные — по умолчанию никакого скрейпинга под логином
  • Встроенные лимиты частоты не дают перегрузить сервер
  • Уважение к robots.txt и sitemap по умолчанию (можно переопределить)
  • Никакого сбора или хранения ПДн — ни нами, ни по умолчанию у пользователей
  • Инструменты, помогающие соблюдать GDPR и CCPA

Прозрачная прокси-сеть

Откуда берутся резидентские IP — тест на честность для любого прокси-провайдера. Вот откуда берутся наши, прямо:

  • Opt-in сеть. Реальные пользователи дают согласие и зарабатывают на раздаче трафика
  • Отписка в один клик в любой момент, без вопросов
  • Проверяемая цепочка поставок с документированным происхождением
  • Ноль вредоносного ПО, ноль скрытых SDK — никогда
  • Мобильные IP с устройств, которыми владеем и управляем мы, а не со взломанных телефонов

Быстрая реакция на злоупотребления

Если кто-то использует нашу инфраструктуру во вред другим, мы хотим об этом знать — и среагировать, пока не стало хуже.

  • Прямая связь с живым человеком, а не очередь тикетов
  • Прозрачный процесс расследования каждого обоснованного обращения
  • Активное сотрудничество с правоохранительными органами по подтверждённым случаям
  • Публичная политика по злоупотреблениям, а не мелкий шрифт
abuse-reports@cyberyozh.com
Average response time: 45 минут

Если сценарий предполагает злоупотребление или вред, наши инструменты не для него. Ответственное использование для нас важнее роста клиентской базы.

Если сценарию нужно скрывать личность, чтобы вредить другим, наши инструменты не для этого. Точка. Мы скорее потеряем клиента, чем принцип.

Наши политики и стандарты

Понятные правила, определяющие то, как мы работаем, — от сбора данных до происхождения прокси и использования платформы. Это реальные политики, которым следует команда, а не краткие пересказы.

Нас любят data-команды и AI-разработчики

Что говорят те, кто строит на Yozh

5,0 / 5 · Отзывов: 5
GitHub
Заменили наш собственный кластер Playwright на Yozh за полдня. MCP-эндпоинт встал прямо в нашего Claude-агента — ноль связующего кода, краулер и скрейпер просто заработали.
Marcus Reinhardt Ведущий дата-инженер Northwind Analytics
X
Система пресетов — киллер-фича. Передаём имя источника и получаем чистый JSON; самовосстановление даже поймало два изменения вёрстки Amazon раньше нас.
Priya Nair Основатель ScrapeStack
Reddit
Наконец-то опенсорсный скрейпер, для которого прокси и сессии — первоклассные сущности. Гоняем его за логин-стенами партнёрских порталов — сессии живут, результаты стабильны в разных регионах.
Daniel Osei Backend-инженер Loopfeed
X
Подключил к Cursor через MCP, и теперь мой агент тянет живые веб-данные прямо посреди задачи. Стриминговый обход по SSE — именно то, чего не хватало агентным сценариям.
Elena Kovac ИИ-инженер Vektor Labs
GitHub
Ушли с платного API скрейпинга ради экономии и готовились к откату по качеству — получили обратное. Self-hosted, без оплаты за запрос, а схема вывода чище, чем та, за которую мы платили.
Sofia Almeida Инженерный менеджер Tabbly

О веб-скрейпинге, краулинге и ИИ-агентах

Блог и статьи

Все статьи
Прокси
Выделенные мобильные прокси в 2026: Почему UDP и VLESS туннели требуются для преодоления DPI
Yozh
Прокси 08/07/2026

Выделенные мобильные прокси в 2026: Почему UDP и VLESS туннели требуются для преодоления DPI

Системы глубокого анализа пакетов (DPI) активно сканируют и сбрасывают стандартные VPN-соединения. А протоколы OpenVPN и WireGuard отказывают за считанные минуты. Их сразу выдают статические заголовки. Современные…

Веб-скрапинг
Лучшая альтернатива Instant Data Scraper в 2026 году
Yozh Scraper
Веб-скрапинг 08/06/2026

Лучшая альтернатива Instant Data Scraper в 2026 году

Сравните Instant Data Scraper с CyberYozh и узнайте, когда становятся необходимы масштабируемые краулеры, ротация прокси, геотаргетинг, сессии и автоматизация.

Прокси
Yozh
Прокси 08/05/2026

Лучшие мобильные прокси для автоматизации в соцсетях (Reddit, Instagram, TikTok)

Сначала автоматизация в Reddit, Instagram или TikTok работает нормально. Но потом ломается без видимых причин. Платформы помечают аккаунты как подозрительные. Сессии слетают. Охваты падают. И это…

Журнал изменений

Журнал изменений и обновления веб-скрейпинга

Yozh Scraper — опенсорсный, все обновления доступны на GitHub. Вот последние ключевые изменения.

v0.1.8 10 августа 2026 Latest

v0.1.8

  • fingerprint_profile on POST /scrape/page, POST /scrape/pages and the crawler/search scrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles: auto (default, resolves to CAMOUFOX_FINGERPRINT_PROFILE, ships windows_on_host), windows_on_host, host, random, and the bare names windows / macos / linux. The old spoof_os keeps working and equals the three bare names; a caller stating both must not name conflicting operating systems. meta.applied_fingerprint reports what actually ran, including when a profile degraded. New env vars CAMOUFOX_FINGERPRINT_PROFILE (default windows_on_host) and HOST_GPU_VENDOR.
  • Extraction warns when a post_process pipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet.
  • GitHub Actions CI: pylint and pytest -m "not e2e" on every push and pull request, the checks the repo already defined but never enforced.
  • run_scrape now returns a typed envelope (ScrapeOk / ScrapeErr) built as the same pydantic models the API validates on the way out, with mypy over the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.
  • session_id, cookies and render are now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed). /search maps the rejection to a 400 rather than a 500.
v0.1.7 4 августа 2026

v0.1.7 — Pin mcp<2.0 so a fresh image build starts

  • mcp 2.0.0 made Server.__init__ keyword-only, which fastapi-mcp 0.4.x still calls positionally, so a clean docker build shipped services that raised TypeError in create_app() before serving anything. Both requirements.txt and yozh-crawler/requirements.txt now pin mcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling once fastapi-mcp ships a release built against mcp 2.x.
v0.1.6 29 июля 2026

v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification

  • Preset extraction repaired for current site layouts:
  • eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
  • Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead urls field.
  • Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
  • Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so From $19.99 / Now 19.99 parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 24 июля 2026

v0.1.5 — Queue goto-timeout retry fix + dependency security updates

  • The queue no longer retries a slow page as if the proxy were bad. A navigation (goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors, net::ERR_*) still rotate and retry as before.
  • Dependency bumps clearing the outstanding advisories in the auxiliary tooling: examples/ (langchain-anthropic) and the local scraper-tester dev harness (express, qs, http-proxy-middleware, follow-redirects). No shipped scraper runtime or API change.
v0.1.0 9 июля 2026 First release

v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2

  • New required services. Browsers no longer run inside the API process. You must now run the redis and scraper-worker services (both are already in docker-compose.yml). Scale capacity with docker compose up -d --scale scraper-worker=N.
  • POST /scrape/page and /scrape/pages can now return 503 queue_full when the Redis stream depth exceeds QUEUE_MAXSIZE (previously the in-memory queue was unbounded).
  • Removed env vars (ignored, warned at startup if set): JOB_TIMEOUT_MS → use PAGE_TASK_TIMEOUT_S; JOB_RESULT_MAX → eviction is now a native Redis TTL (JOB_RESULT_TTL_S); JOBS_ENABLED → the queue is always on.
  • New env vars: REDIS_URL, PAGE_TASK_TIMEOUT_S, LOGIN_TASK_TIMEOUT_S, LOGIN_RESULT_GRACE_S, RECLAIM_IDLE_S, JOB_RESULT_TTL_S, BROWSER_MAX_PAGES, BROWSER_IDLE_SHUTDOWN_S, WARMUP_DWELL_MS.
  • The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The web-scraper container only enqueues page tasks and reads results; browsers run in separate, horizontally scalable scraper-worker containers.
Быстрый старт

Начните веб-скрейпинг за секунды

Три команды — и у вас работающий скрейпер + краулер с HTTP- и MCP-эндпоинтами.

1 Клонировать
git clone https://github.com/\
  CyberYozh-data/yozh-scraper
cd yozh-scraper
2 Запустить
cp .env.example .env
docker compose up --build
3 Скрейпить
curl -X POST localhost:8000/api/v1/scrape/page \
  -H 'Content-Type: application/json' \
  -d '{"url":"https://example.com"}'
Полная документация Подключить к Claude / Cursor через MCP →
Контакты · Поддержка

Связаться с нами

Живой человек читает всё, что приходит. Выберите удобный канал — Telegram самый быстрый.

Офис
Jurija Gagarina 231/329
Нови-Београд · Сербия
Двухуровневая поддержка, почти круглосуточно Первая линия на дежурстве почти 24/7. Сложные случаи ведут старшие инженеры.
Открытый код · Лицензия MIT · 84 ★

Готовы скрейпить?

Yozh Crawler + Scraper бесплатны. Навсегда. Поставьте звезду, если помогает — каждая звезда на счету.

Yozh Crawler + Scraper распространяются под лицензией MIT. Используйте. Форкайте. Создавайте на их основе.