Заменили наш собственный кластер Playwright на Yozh за полдня. MCP-эндпоинт встал прямо в нашего Claude-агента — ноль связующего кода, краулер и скрейпер просто заработали.
Простой веб-скрейпинг
для ИИ-агентов
и людей
Один опенсорсный инструмент для сбора данных и скрейпинга. Стартуйте с одного URL, обойдите сайт и получайте структурированные данные по мере загрузки страниц. Работает с MCP и инструментами вроде Claude и Cursor, с готовыми пресетами для маркетплейсов Amazon и eBay.
Обходите целые сайты и получайте данные за один прогон
Yozh Crawler строит полную структуру сайта и обрабатывает страницы по мере их обнаружения. Вы получаете и охват, и готовые результаты за один прогон, без раздельных шагов обхода и скрейпинга. Работает прямо внутри ваших процессов сбора данных.
Yozh Crawler, встроенный NEW
Стартуйте с одного URL и стройте карту всего сайта. Страницы находятся и обрабатываются за один прогон, так что вы получаете полный охват без лишних шагов.
Режим обнаружения NEW
Нужны только ссылки? Переключитесь в режим обнаружения и стройте карту сайта без парсинга. Быстрее, легче и полезно для аудита и проверок структуры.
Stealth-браузер
Согласует заголовки, локацию и сигналы браузера с вашим прокси. Помогает держать сессии стабильными в разных регионах.
Пакетный скрейпинг
Запускайте сотни URL одним запросом. Обрабатывайте всё параллельно с одним чистым выводом.
Двухэтапная отмена NEW
Останавливайте задачи, не ломая результаты. Дайте активным страницам доработать или остановите всё мгновенно.
Интеграция с MCP
Подключайтесь напрямую к инструментам вроде Claude и Cursor. Используйте скрейпинг и обход как часть привычных процессов.
10 встроенных пресетов
Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — передайте имя источника и параметры, получите нормализованный ответ. Никаких селекторов писать не нужно.
LLM-самовосстановление NEW
Сайт выкатил изменение вёрстки и ваши CSS-селекторы возвращают пусто? Парсер просит LLM (OpenAI / Anthropic / Gemini / OpenRouter) перегенерировать селектор на лету. Пайплайн продолжает работать.
Пресеты, сгенерированные ИИ NEW
Нужен сайт, для которого у нас нет пресета? Опишите, что извлечь, и вставьте пример URL — POST /api/v1/presets/generate вернёт готовый JSON пресета.
Авторизованные сессии NEW
Войдите один раз через декларативный DSL (goto / fill / click / wait) или вставьте экспортированные cookies. Переиспользуйте сессию в каждом скрейпе. Обязательно для закрытых целей вроде пресета LinkedIn.
Простая инфраструктура скрейпинга под вашим контролем
Настройте процесс в одном месте и запускайте его так, как нужно. Всё понятно, организованно и легко управляется без лишних инструментов.
Встроенные прокси, готовые к работе
Доступ к резидентским, мобильным и датацентр-прокси в 120+ странах. Более 50 миллионов IP при аптайме 99,9%. Включает поддержку фингерпринтинга для согласования устройства, браузера и сетевого поведения ради стабильных сессий и лучшего контроля.
Гибкое извлечение данных
Используйте CSS-селекторы, XPath или авто-определение для популярных сайтов. Получайте чистый структурированный JSON без сложной настройки.
Все данные в одном месте
Получайте сырой HTML, скриншоты и распарсенные данные вместе. Всё, что нужно, без переключения между инструментами.
Простое управление и доступ по MCP
Останавливайте задачи в любой момент одним кликом и переключайтесь между скрейпером и краулером. Ваш процесс остаётся простым и под контролем.
ИИ-агенты, созданные для веб-скрейпинга и обхода
Подключите Yozh Crawler и Yozh Scraper к Claude, Cursor или любому MCP-клиенту. Переключайте инструменты одним тумблером, без лишнего кода.
Возможности веб-скрейпинга
Все возможности Yozh Scraper доступны как функции для вашего агента, включая скрейпинг, пакетные прогоны и скриншоты.
Минута на подключение
Скопируйте конфиг, перезапустите клиент — и готово.
Работает с любым MCP-клиентом
Claude Desktop, Cursor, Cline или кастомные агенты.
Полный контроль над набором инструментов
Выбирайте, как агент выполняет задачи — от отдельных страниц до целых пакетов.
Запускайте как удобно
Используйте локальный MCP-сервер или разверните его на своей инфраструктуре.
// ~/Library/Application Support/Claude/claude_desktop_config.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cursor → Settings → MCP → Add new MCP Server { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cline → MCP Servers → Edit cline_mcp_settings.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp", "disabled": false }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp", "disabled": false } } }
// Anthropic Messages API · MCP via Streamable HTTP // Note: scraper must be reachable from Anthropic's servers (deploy publicly) import Anthropic from "@anthropic-ai/sdk"; const response = await new Anthropic().messages.create({ model: "claude-opus-4-8", mcp_servers: [ { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" }, { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" } ], messages: [...] });
Обход, стриминг и парсинг страниц в реальном времени
Yozh Crawler стартует с одного URL, находит страницы по всему сайту и обрабатывает их по мере загрузки — вы получаете полную структуру и готовые данные за один прогон.
Стриминг в реальном времени
Страницы появляются по мере обнаружения и обработки. Подключайтесь напрямую из клиента, агента или пайплайна, не дожидаясь полного прогона.
Режим обнаружения
Нужны только ссылки? Стройте карту сайта без парсинга. Быстрее и экономичнее для проверок структуры и аудита.
Двухэтапная отмена
Безопасно останавливайте задачи. Дайте активным страницам доработать или остановите всё мгновенно, когда нужно.
Переключатель MCP-цели
Переключайтесь между скрейпером и краулером одним тумблером. Ваш агент использует правильный инструмент под каждую задачу.
Живое дерево сайта в UI
Смотрите, как структура сайта строится в реальном времени. Следите за прогрессом страница за страницей, не покидая дашборд.
Result
▶ Site Map (0 pages)
| URL | Parent | Depth | Status | Took |
|---|
От одного URL до полного охвата сайта
Краулер находит страницы, скрейпер их обрабатывает, а ваш ИИ-агент использует результаты — подходит и новичкам, и экспертам.
Краулер
Находит все URL
Yozh Scraper
Извлекает в JSON
ИИ-агент
Анализирует и решает
Конкурентный анализ
Отслеживайте каталоги, цены и характеристики товаров конкурентов в одном месте. Находите пробелы в своих листингах и быстрее реагируйте на изменения рынка.
Мониторинг цен
Автоматически отслеживайте изменения цен на маркетплейсах. Настройте оповещения и получайте уведомления в Telegram или Slack при изменении цен.
Данные для обучения ML
Собирайте чистые структурированные датасеты из публичных источников, готовые для анализа или обучения моделей. Создано для надёжного сбора данных в масштабе.
Начните скрейпить сразу с готовыми пресетами
Локали, валюты, селекторы и обработка антибота — уже настроены. Выберите пресет, чтобы увидеть, что извлекается.
Every Amazon listing, normalized
All fields below are extracted automatically — no selectors to write.
Нужен сайт, который мы ещё не покрываем?
Откройте issue на GitHub или предложите свой пресет — мы рассматриваем PR в течение недели.
Прокси, созданные для скрейпинга
Три типа, шесть конфигураций. Выбирайте по задаче, скорости и бюджету.
Мобильные 4G/5G
Настоящие мобильные устройства в сетях операторов. Наивысший уровень доверия для строгих анти-бот систем.
Личное устройство, ручная ротация IP через API
Одно устройство, несколько пользователей
Подробнее о мобильных прокси
Как это работает
Каждый IP — с настоящего смартфона или LTE/5G-модема, подключённого к крупному мобильному оператору. IP используется тысячами обычных абонентов, поэтому его блокировка заблокировала бы реальных людей — именно поэтому анти-бот системы доверяют мобильным IP больше всего.
Лучше всего для
- Управление аккаунтами в соцсетях
- Агрессивные анти-бот цели (Cloudflare, PerimeterX)
- Партнёрский маркетинг и проверка рекламы
- Задачи, требующие устойчивого «человеческого» доверия
Характеристики
- Сети 4G LTE и 5G по всему миру
- Поддержка UDP, подключение VPN VLESS
- Ручная ротация IP через API или ссылку в панели
- Подстройка отпечатка ОС
- Безлимитный трафик на большинстве тарифов
Резидентные
IP реальных домашних интернет-пользователей в 120+ странах. Доступ к 50M+ IP с отличным балансом доверия и цены.
Настоящие роутеры, фиксированный IP на весь срок аренды
Пул 100M+ IP, авторотация по таймеру или на каждый запрос
Подробнее о резидентных прокси
Как это работает
Резидентные IP берутся у реальных домашних интернет-абонентов, которые добровольно делятся трафиком за вознаграждение через прозрачную opt-in сеть. Их соединение выглядит как у любого домашнего пользователя — потому что так и есть.
Лучше всего для
- Скрейпинг в масштабе (оптимальный сценарий)
- Сбор данных с маркетплейсов
- SEO-исследования, скрейпинг выдачи (SERP)
- Мониторинг брендов и цен
- Кампании по проверке рекламы
Характеристики
- 120+ стран, 100M+ уникальных IP в ротируемом пуле
- Выбор статичных или ротируемых под задачу
- Таргетинг по городу и ASN
- Поддержка протоколов HTTPS, SOCKS5
- Закреплённые сессии до 30 минут
Датацентровые
Максимальная скорость, минимальная цена. 2M+ IP в дата-центрах по всему миру.
Один IP закреплён за вами, безлимитный трафик
Общий пул, бюджетный вариант для простых задач
Подробнее о датацентровых прокси
Как это работает
IP размещены в дата-центрах и не связаны с домашними или мобильными пользователями. Они дешевле и быстрее резидентных, но анти-бот системы могут распознать их как не-человеческие, поэтому используйте их там, где доверие не критично.
Лучше всего для
- Массовый скрейпинг лояльных сайтов
- Внутренние инструменты и нагрузочное тестирование
- API-эндпоинты без фильтров по доверию к IP
- Задачи, где скорость важнее маскировки
Характеристики
- 2M+ адресов IPv4 и IPv6
- Выделенные или общие конфигурации
- Безлимитный трафик на выделенных тарифах
- Поддержка протоколов HTTPS, SOCKS5
- Самая низкая задержка из всех трёх типов
Этика встроена в то, как мы управляем платформой
Открытый код — это лишь отправная точка. То, как собираются данные и откуда берутся прокси, важно не меньше. Это стандарты, которым мы следуем на практике, а не заявления на странице.
Этичный сбор данных
Мы строим инструменты, а не лазейки. Yozh Scraper сделан так, чтобы легитимный скрейпинг публичных данных был надёжным — а не чтобы взламывать то, что должно оставаться закрытым.
- Только публично доступные данные — по умолчанию никакого скрейпинга под логином
- Встроенные лимиты частоты не дают перегрузить сервер
- Уважение к robots.txt и sitemap по умолчанию (можно переопределить)
- Никакого сбора или хранения ПДн — ни нами, ни по умолчанию у пользователей
- Инструменты, помогающие соблюдать GDPR и CCPA
Прозрачная прокси-сеть
Откуда берутся резидентские IP — тест на честность для любого прокси-провайдера. Вот откуда берутся наши, прямо:
- Opt-in сеть. Реальные пользователи дают согласие и зарабатывают на раздаче трафика
- Отписка в один клик в любой момент, без вопросов
- Проверяемая цепочка поставок с документированным происхождением
- Ноль вредоносного ПО, ноль скрытых SDK — никогда
- Мобильные IP с устройств, которыми владеем и управляем мы, а не со взломанных телефонов
Быстрая реакция на злоупотребления
Если кто-то использует нашу инфраструктуру во вред другим, мы хотим об этом знать — и среагировать, пока не стало хуже.
- Прямая связь с живым человеком, а не очередь тикетов
- Прозрачный процесс расследования каждого обоснованного обращения
- Активное сотрудничество с правоохранительными органами по подтверждённым случаям
- Публичная политика по злоупотреблениям, а не мелкий шрифт
Если сценарий предполагает злоупотребление или вред, наши инструменты не для него. Ответственное использование для нас важнее роста клиентской базы.
Если сценарию нужно скрывать личность, чтобы вредить другим, наши инструменты не для этого. Точка. Мы скорее потеряем клиента, чем принцип.
Наши политики и стандарты
Понятные правила, определяющие то, как мы работаем, — от сбора данных до происхождения прокси и использования платформы. Это реальные политики, которым следует команда, а не краткие пересказы.
Политика использования
Определяет, что разрешено в нашей инфраструктуре, а что ограничено, с чётким обоснованием.
Политика реагирования на злоупотребления
Объясняет, как жалобы рассматриваются, обрабатываются и разрешаются, включая сроки реагирования.
Стандарты формирования сети
Подробно описывает, как формируется пул резидентных и мобильных IP, с моделью добровольного согласия и проверенными источниками.
Политика проверки клиентов
Охватывает онбординг, случаи, когда требуется верификация, и порядок обработки данных пользователей.
Ограниченные цели
Перечисляет заблокированные домены и сценарии использования, включая чувствительные отрасли, такие как госсектор и финансы.
Политика обработки данных
Объясняет, какие данные собираются, какие не хранятся, сроки хранения и передачу третьим сторонам.
Как команды используют
CyberYozh Data
Реальные внедрения
Веб-скрейпинг и аналитика
Автоматизируйте масштабный сбор публичных данных: каталоги товаров, рейтинги, отзывы, гео-данные. Yozh Scraper плюс резидентские прокси — легально, стабильно и чисто.
Читать далее
ИИ-агенты и автоматизация
Стройте автономных агентов, которые скрейпят, анализируют и действуют. Интеграция MCP превращает Yozh Scraper в нативный инструмент для Claude и Cursor — без кастомной интеграции.
Читать далее
E-commerce и маркетплейсы
Отслеживайте цены, остатки и наличие товаров на Amazon, eBay и остальных маркетплейсах мира. Пресеты экономят недели разработки.
Читать далееЧто говорят пресса и бизнес
Честные оценки от независимых источников
Все статьи
AFFMaven Reviews CyberYozh's Proxy & Multi-Accounting Platform
"CyberYozh stands out as a powerful platform for affiliates and arbitrage teams, combining reliable proxy infrastructure, identity tools, and strong support in one ecosystem."
TechBullion Covers CyberYozh's B2B Platform Expansion
"CyberYozh App enables businesses to launch, test, and operate digital products across more than 30 countries through a scalable infrastructure built for global connectivity, verification, and digital operations."
Grit Daily Highlights CyberYozh's Infrastructure for Enterprise Proxy Workloads
"Built for organizations that rely on proxies every day, CyberYozh App delivers infrastructure designed for stability, scalability, and high-volume workloads rather than one-off sessions."
Нас любят data-команды и AI-разработчики
Что говорят те, кто строит на Yozh
Система пресетов — киллер-фича. Передаём имя источника и получаем чистый JSON; самовосстановление даже поймало два изменения вёрстки Amazon раньше нас.
Наконец-то опенсорсный скрейпер, для которого прокси и сессии — первоклассные сущности. Гоняем его за логин-стенами партнёрских порталов — сессии живут, результаты стабильны в разных регионах.
Подключил к Cursor через MCP, и теперь мой агент тянет живые веб-данные прямо посреди задачи. Стриминговый обход по SSE — именно то, чего не хватало агентным сценариям.
Ушли с платного API скрейпинга ради экономии и готовились к откату по качеству — получили обратное. Self-hosted, без оплаты за запрос, а схема вывода чище, чем та, за которую мы платили.
О веб-скрейпинге, краулинге и ИИ-агентах
Блог и статьи
Все статьиМасштабирование RAG-систем: Очистка DOM-дерева и правильные MCP прокси для парсинга
Современные целевые сайты безжалостно отклоняют автоматизированные запросы. Вы запускаете краулер для сбора данных с товарного каталога. Система защиты моментально сканирует ваш TLS-отпечаток. Она проверяет порядок следования…
Сбор данных с сайтов в 2026 году: методы, инструменты и как масштабировать процесс
Узнайте, как устроен сбор данных с веб-сайтов, какие методы подходят для разных сайтов, какие инструменты для этого нужны и как автоматизировать надёжный сбор данных в промышленных…
Автоматизированный веб-скрапинг с Python: Обработка ротации мобильных IP через REST API
TL;DR: Отказ от тяжёлых браузеров Браузерная автоматизация несёт колоссальные вычислительные издержки. Безголовые браузеры потребляют гигабайты оперативной памяти. Они рендерят ненужные элементы DOM-дерева. Они вызывают пиковые нагрузки…
Журнал изменений и обновления веб-скрейпинга
Yozh Scraper — опенсорсный, все обновления доступны на GitHub. Вот последние ключевые изменения.
v0.1.13
- Row-scoped extraction. An extract rule takes a
containerselector; every device=legacy_wap— a feature-phone identity that unlocks Google's no-JSresolve_redirects— names extracted fields whose values are the page's- New built-in presets:
ozon_search,ozon_product,mobile_de_search, - A warning when a search engine answered a different query than the one asked.
v0.1.12
- Every built-in preset now ships as an explicit per-engine variant,
<name>_chromiumand<name>_camoufox(e.g.google_search_chromium,yandex_search_camoufox). A request names the exact variant it wants; each preset carries its ownbrowser_engine. - Structured, correlated logging: business events get stable names and a request/job correlation id threaded through the scrape -> queue -> browser chain, so success/error rate and latency are answerable from logs. An opt-in JSON log shape is available via
LOG_FORMAT=json(defaulttext). - Browser egress policy knobs: an
EGRESS_ALLOW_HOSTSallowlist (empty by default) and anEGRESS_TRANSPORT_GUARDtoggle (on by default). - BREAKING (presets): the old single-name built-ins (
google_search,google_shopping,amazon_product,amazon_search,bing_search,ebay_search,linkedin_profile,walmart_product,yandex_search,youtube_video) are replaced by their per-engine variants. A request using a bare old name now returns 404preset_not_found; append the engine suffix (_chromium, or_camoufoxfor the two anti-bot targetsyandex_searchandwalmart_product). - BREAKING (deploy):
GET /api/v1/proxies/availableand the entire/api/v2/prem-proxies/*catalog now requireSERVICE_TOKENand fail closed (503 when the token is unconfigured, 401 without it). Any consumer of these endpoints must send theX-Service-Tokenheader; deploy the consumer first, or its calls degrade (for the proxy geo catalog, silently).
v0.1.11
- The job results response carries
unreadable_slots. A job with one corrupt or schema-skewed result slot now returns its other pages (HTTP 200) and names the bad slot, instead of the whole job failing with a 500 and becoming un-cancellable until its TTL expires. - The login-replay page is masked with the same host-aligned WebGL/GPU, native-looking
navigator, and Client-Hints (Sec-CH-UA) as the main fetch path, via a shared page-preparation helper. A credentialed login no longer submits a contradictory fingerprint (previously a macOS GPU and aHeadlessChromeClient-Hint under a Windows user agent). - Self-heal can no longer persist a degraded preset over a working one. It now contributes only the regenerated selector (and its dialect), keeping the preset's
all/attr/post_processand required fields, and it is graded against the original contract — so a heal that returns a bare string where a coerced list belongs is no longer counted as a recovery. It also never heals from a transient 5xx error page. This closes a class of silent preset corruption. - Proxy credentials are kept out of logs, error messages and 502 response bodies. The SOCKS bridge, the rotating-credentials response and the username log no longer emit
user:pass; a shared redactor masks proxy URLs while preservinghost:portfor diagnostics. litellmis bounded<1.98: 1.98.0 importsNotRequiredfromtypingunguarded and fails to import on the Python 3.10 this project targets, so a fresh install or image build would produce a container that cannot start.
v0.1.10
- Chromium WebGL now claims the host's actual GPU vendor/renderer, kept coherent with the Windows fingerprint the browser already presents, reusing the host-GPU detection from the Camoufox path (
HOST_GPU_VENDOR). Without it the restored context reported a generic SwiftShader/ANGLE software-renderer string, itself an automation tell. - Chromium returned a null WebGL context on GPU-less / headless hosts (Chrome 136+ dropped the automatic SwiftShader fallback), and "no WebGL context at all" is a strong bot tell that real desktop Chrome never shows. A working software WebGL context is restored via
--enable-unsafe-swiftshader, gated by the newSOFTWARE_WEBGLsetting (default on, Chromium-only; revertible by env without a code change). - README now links the project site (
data.cyberyozh.pro) with per-service pages for the scraper and crawler.
v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2
- New required services. Browsers no longer run inside the API process. You must now run the
redisandscraper-workerservices (both are already indocker-compose.yml). Scale capacity withdocker compose up -d --scale scraper-worker=N. POST /scrape/pageand/scrape/pagescan now return503 queue_fullwhen the Redis stream depth exceedsQUEUE_MAXSIZE(previously the in-memory queue was unbounded).- Removed env vars (ignored, warned at startup if set):
JOB_TIMEOUT_MS→ usePAGE_TASK_TIMEOUT_S;JOB_RESULT_MAX→ eviction is now a native Redis TTL (JOB_RESULT_TTL_S);JOBS_ENABLED→ the queue is always on. - New env vars:
REDIS_URL,PAGE_TASK_TIMEOUT_S,LOGIN_TASK_TIMEOUT_S,LOGIN_RESULT_GRACE_S,RECLAIM_IDLE_S,JOB_RESULT_TTL_S,BROWSER_MAX_PAGES,BROWSER_IDLE_SHUTDOWN_S,WARMUP_DWELL_MS. - The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The
web-scrapercontainer only enqueues page tasks and reads results; browsers run in separate, horizontally scalablescraper-workercontainers.
Начните веб-скрейпинг за секунды
Три команды — и у вас работающий скрейпер + краулер с HTTP- и MCP-эндпоинтами.
git clone https://github.com/\ CyberYozh-data/yozh-scraper cd yozh-scraper
cp .env.example .env docker compose up --build
curl -X POST localhost:8000/api/v1/scrape/page \
-H 'Content-Type: application/json' \
-d '{"url":"https://example.com"}'
Связаться с нами
Живой человек читает всё, что приходит. Выберите удобный канал — Telegram самый быстрый.
Готовы скрейпить?
Yozh Crawler + Scraper бесплатны. Навсегда. Поставьте звезду, если помогает — каждая звезда на счету.
Yozh Crawler + Scraper распространяются под лицензией MIT. Используйте. Форкайте. Создавайте на их основе.