Заменили наш собственный кластер Playwright на Yozh за полдня. MCP-эндпоинт встал прямо в нашего Claude-агента — ноль связующего кода, краулер и скрейпер просто заработали.
Простой веб-скрейпинг
для ИИ-агентов
и людей
Один опенсорсный инструмент для сбора данных и скрейпинга. Стартуйте с одного URL, обойдите сайт и получайте структурированные данные по мере загрузки страниц. Работает с MCP и инструментами вроде Claude и Cursor, с готовыми пресетами для маркетплейсов Amazon и eBay.
Обходите целые сайты и получайте данные за один прогон
Yozh Crawler строит полную структуру сайта и обрабатывает страницы по мере их обнаружения. Вы получаете и охват, и готовые результаты за один прогон, без раздельных шагов обхода и скрейпинга. Работает прямо внутри ваших процессов сбора данных.
Yozh Crawler, встроенный NEW
Стартуйте с одного URL и стройте карту всего сайта. Страницы находятся и обрабатываются за один прогон, так что вы получаете полный охват без лишних шагов.
Режим обнаружения NEW
Нужны только ссылки? Переключитесь в режим обнаружения и стройте карту сайта без парсинга. Быстрее, легче и полезно для аудита и проверок структуры.
Stealth-браузер
Согласует заголовки, локацию и сигналы браузера с вашим прокси. Помогает держать сессии стабильными в разных регионах.
Пакетный скрейпинг
Запускайте сотни URL одним запросом. Обрабатывайте всё параллельно с одним чистым выводом.
Двухэтапная отмена NEW
Останавливайте задачи, не ломая результаты. Дайте активным страницам доработать или остановите всё мгновенно.
Интеграция с MCP
Подключайтесь напрямую к инструментам вроде Claude и Cursor. Используйте скрейпинг и обход как часть привычных процессов.
10 встроенных пресетов
Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — передайте имя источника и параметры, получите нормализованный ответ. Никаких селекторов писать не нужно.
LLM-самовосстановление NEW
Сайт выкатил изменение вёрстки и ваши CSS-селекторы возвращают пусто? Парсер просит LLM (OpenAI / Anthropic / Gemini / OpenRouter) перегенерировать селектор на лету. Пайплайн продолжает работать.
Пресеты, сгенерированные ИИ NEW
Нужен сайт, для которого у нас нет пресета? Опишите, что извлечь, и вставьте пример URL — POST /api/v1/presets/generate вернёт готовый JSON пресета.
Авторизованные сессии NEW
Войдите один раз через декларативный DSL (goto / fill / click / wait) или вставьте экспортированные cookies. Переиспользуйте сессию в каждом скрейпе. Обязательно для закрытых целей вроде пресета LinkedIn.
Простая инфраструктура скрейпинга под вашим контролем
Настройте процесс в одном месте и запускайте его так, как нужно. Всё понятно, организованно и легко управляется без лишних инструментов.
Встроенные прокси, готовые к работе
Доступ к резидентским, мобильным и датацентр-прокси в 120+ странах. Более 50 миллионов IP при аптайме 99,9%. Включает поддержку фингерпринтинга для согласования устройства, браузера и сетевого поведения ради стабильных сессий и лучшего контроля.
Гибкое извлечение данных
Используйте CSS-селекторы, XPath или авто-определение для популярных сайтов. Получайте чистый структурированный JSON без сложной настройки.
Все данные в одном месте
Получайте сырой HTML, скриншоты и распарсенные данные вместе. Всё, что нужно, без переключения между инструментами.
Простое управление и доступ по MCP
Останавливайте задачи в любой момент одним кликом и переключайтесь между скрейпером и краулером. Ваш процесс остаётся простым и под контролем.
ИИ-агенты, созданные для веб-скрейпинга и обхода
Подключите Yozh Crawler и Yozh Scraper к Claude, Cursor или любому MCP-клиенту. Переключайте инструменты одним тумблером, без лишнего кода.
Возможности веб-скрейпинга
Все возможности Yozh Scraper доступны как функции для вашего агента, включая скрейпинг, пакетные прогоны и скриншоты.
Минута на подключение
Скопируйте конфиг, перезапустите клиент — и готово.
Работает с любым MCP-клиентом
Claude Desktop, Cursor, Cline или кастомные агенты.
Полный контроль над набором инструментов
Выбирайте, как агент выполняет задачи — от отдельных страниц до целых пакетов.
Запускайте как удобно
Используйте локальный MCP-сервер или разверните его на своей инфраструктуре.
// ~/Library/Application Support/Claude/claude_desktop_config.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cursor → Settings → MCP → Add new MCP Server { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cline → MCP Servers → Edit cline_mcp_settings.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp", "disabled": false }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp", "disabled": false } } }
// Anthropic Messages API · MCP via Streamable HTTP // Note: scraper must be reachable from Anthropic's servers (deploy publicly) import Anthropic from "@anthropic-ai/sdk"; const response = await new Anthropic().messages.create({ model: "claude-opus-4-8", mcp_servers: [ { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" }, { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" } ], messages: [...] });
Обход, стриминг и парсинг страниц в реальном времени
Yozh Crawler стартует с одного URL, находит страницы по всему сайту и обрабатывает их по мере загрузки — вы получаете полную структуру и готовые данные за один прогон.
Стриминг в реальном времени
Страницы появляются по мере обнаружения и обработки. Подключайтесь напрямую из клиента, агента или пайплайна, не дожидаясь полного прогона.
Режим обнаружения
Нужны только ссылки? Стройте карту сайта без парсинга. Быстрее и экономичнее для проверок структуры и аудита.
Двухэтапная отмена
Безопасно останавливайте задачи. Дайте активным страницам доработать или остановите всё мгновенно, когда нужно.
Переключатель MCP-цели
Переключайтесь между скрейпером и краулером одним тумблером. Ваш агент использует правильный инструмент под каждую задачу.
Живое дерево сайта в UI
Смотрите, как структура сайта строится в реальном времени. Следите за прогрессом страница за страницей, не покидая дашборд.
Result
▶ Site Map (0 pages)
| URL | Parent | Depth | Status | Took |
|---|
От одного URL до полного охвата сайта
Краулер находит страницы, скрейпер их обрабатывает, а ваш ИИ-агент использует результаты — подходит и новичкам, и экспертам.
Краулер
Находит все URL
Yozh Scraper
Извлекает в JSON
ИИ-агент
Анализирует и решает
Конкурентный анализ
Отслеживайте каталоги, цены и характеристики товаров конкурентов в одном месте. Находите пробелы в своих листингах и быстрее реагируйте на изменения рынка.
Мониторинг цен
Автоматически отслеживайте изменения цен на маркетплейсах. Настройте оповещения и получайте уведомления в Telegram или Slack при изменении цен.
Данные для обучения ML
Собирайте чистые структурированные датасеты из публичных источников, готовые для анализа или обучения моделей. Создано для надёжного сбора данных в масштабе.
Начните скрейпить сразу с готовыми пресетами
Локали, валюты, селекторы и обработка антибота — уже настроены. Выберите пресет, чтобы увидеть, что извлекается.
Every Amazon listing, normalized
All fields below are extracted automatically — no selectors to write.
Нужен сайт, который мы ещё не покрываем?
Откройте issue на GitHub или предложите свой пресет — мы рассматриваем PR в течение недели.
Прокси, созданные для скрейпинга
Три типа, шесть конфигураций. Выбирайте по задаче, скорости и бюджету.
Мобильные 4G/5G
Настоящие мобильные устройства в сетях операторов. Наивысший уровень доверия для строгих анти-бот систем.
Личное устройство, ручная ротация IP через API
Одно устройство, несколько пользователей
Подробнее о мобильных прокси
Как это работает
Каждый IP — с настоящего смартфона или LTE/5G-модема, подключённого к крупному мобильному оператору. IP используется тысячами обычных абонентов, поэтому его блокировка заблокировала бы реальных людей — именно поэтому анти-бот системы доверяют мобильным IP больше всего.
Лучше всего для
- Управление аккаунтами в соцсетях
- Агрессивные анти-бот цели (Cloudflare, PerimeterX)
- Партнёрский маркетинг и проверка рекламы
- Задачи, требующие устойчивого «человеческого» доверия
Характеристики
- Сети 4G LTE и 5G по всему миру
- Поддержка UDP, подключение VPN VLS
- Ручная ротация IP через API или ссылку в панели
- Подстройка отпечатка ОС
- Безлимитный трафик на большинстве тарифов
Резидентные
IP реальных домашних интернет-пользователей в 120+ странах. Доступ к 50M+ IP с отличным балансом доверия и цены.
Настоящие роутеры, фиксированный IP на весь срок аренды
Пул 100M+ IP, авторотация по таймеру или на каждый запрос
Подробнее о резидентных прокси
Как это работает
Резидентные IP берутся у реальных домашних интернет-абонентов, которые добровольно делятся трафиком за вознаграждение через прозрачную opt-in сеть. Их соединение выглядит как у любого домашнего пользователя — потому что так и есть.
Лучше всего для
- Скрейпинг в масштабе (оптимальный сценарий)
- Сбор данных с маркетплейсов
- SEO-исследования, скрейпинг выдачи (SERP)
- Мониторинг брендов и цен
- Кампании по проверке рекламы
Характеристики
- 120+ стран, 100M+ уникальных IP в ротируемом пуле
- Выбор статичных или ротируемых под задачу
- Таргетинг по городу и ASN
- Поддержка протоколов HTTPS, SOCKS5
- Закреплённые сессии до 30 минут
Датацентровые
Максимальная скорость, минимальная цена. 2M+ IP в дата-центрах по всему миру.
Один IP закреплён за вами, безлимитный трафик
Общий пул, бюджетный вариант для простых задач
Подробнее о датацентровых прокси
Как это работает
IP размещены в дата-центрах и не связаны с домашними или мобильными пользователями. Они дешевле и быстрее резидентных, но анти-бот системы могут распознать их как не-человеческие, поэтому используйте их там, где доверие не критично.
Лучше всего для
- Массовый скрейпинг лояльных сайтов
- Внутренние инструменты и нагрузочное тестирование
- API-эндпоинты без фильтров по доверию к IP
- Задачи, где скорость важнее маскировки
Характеристики
- 2M+ адресов IPv4 и IPv6
- Выделенные или общие конфигурации
- Безлимитный трафик на выделенных тарифах
- Поддержка протоколов HTTPS, SOCKS5
- Самая низкая задержка из всех трёх типов
Этика встроена в то, как мы управляем платформой
Открытый код — это лишь отправная точка. То, как собираются данные и откуда берутся прокси, важно не меньше. Это стандарты, которым мы следуем на практике, а не заявления на странице.
Этичный сбор данных
Мы строим инструменты, а не лазейки. Yozh Scraper сделан так, чтобы легитимный скрейпинг публичных данных был надёжным — а не чтобы взламывать то, что должно оставаться закрытым.
- Только публично доступные данные — по умолчанию никакого скрейпинга под логином
- Встроенные лимиты частоты не дают перегрузить сервер
- Уважение к robots.txt и sitemap по умолчанию (можно переопределить)
- Никакого сбора или хранения ПДн — ни нами, ни по умолчанию у пользователей
- Инструменты, помогающие соблюдать GDPR и CCPA
Прозрачная прокси-сеть
Откуда берутся резидентские IP — тест на честность для любого прокси-провайдера. Вот откуда берутся наши, прямо:
- Opt-in сеть. Реальные пользователи дают согласие и зарабатывают на раздаче трафика
- Отписка в один клик в любой момент, без вопросов
- Проверяемая цепочка поставок с документированным происхождением
- Ноль вредоносного ПО, ноль скрытых SDK — никогда
- Мобильные IP с устройств, которыми владеем и управляем мы, а не со взломанных телефонов
Быстрая реакция на злоупотребления
Если кто-то использует нашу инфраструктуру во вред другим, мы хотим об этом знать — и среагировать, пока не стало хуже.
- Прямая связь с живым человеком, а не очередь тикетов
- Прозрачный процесс расследования каждого обоснованного обращения
- Активное сотрудничество с правоохранительными органами по подтверждённым случаям
- Публичная политика по злоупотреблениям, а не мелкий шрифт
Если сценарий предполагает злоупотребление или вред, наши инструменты не для него. Ответственное использование для нас важнее роста клиентской базы.
Если сценарию нужно скрывать личность, чтобы вредить другим, наши инструменты не для этого. Точка. Мы скорее потеряем клиента, чем принцип.
Наши политики и стандарты
Понятные правила, определяющие то, как мы работаем, — от сбора данных до происхождения прокси и использования платформы. Это реальные политики, которым следует команда, а не краткие пересказы.
Политика использования
Определяет, что разрешено в нашей инфраструктуре, а что ограничено, с чётким обоснованием.
Политика реагирования на злоупотребления
Объясняет, как жалобы рассматриваются, обрабатываются и разрешаются, включая сроки реагирования.
Стандарты формирования сети
Подробно описывает, как формируется пул резидентных и мобильных IP, с моделью добровольного согласия и проверенными источниками.
Политика проверки клиентов
Охватывает онбординг, случаи, когда требуется верификация, и порядок обработки данных пользователей.
Ограниченные цели
Перечисляет заблокированные домены и сценарии использования, включая чувствительные отрасли, такие как госсектор и финансы.
Политика обработки данных
Объясняет, какие данные собираются, какие не хранятся, сроки хранения и передачу третьим сторонам.
Как команды используют
CyberYozh Data
Реальные внедрения
Веб-скрейпинг и аналитика
Автоматизируйте масштабный сбор публичных данных: каталоги товаров, рейтинги, отзывы, гео-данные. Yozh Scraper плюс резидентские прокси — легально, стабильно и чисто.
Читать далее
ИИ-агенты и автоматизация
Стройте автономных агентов, которые скрейпят, анализируют и действуют. Интеграция MCP превращает Yozh Scraper в нативный инструмент для Claude и Cursor — без кастомной интеграции.
Читать далее
E-commerce и маркетплейсы
Отслеживайте цены, остатки и наличие товаров на Amazon, eBay и остальных маркетплейсах мира. Пресеты экономят недели разработки.
Читать далееЧто говорят пресса и бизнес
Честные оценки от независимых источников
Все статьи
AFFMaven Reviews CyberYozh's Proxy & Multi-Accounting Platform
"CyberYozh stands out as a powerful platform for affiliates and arbitrage teams, combining reliable proxy infrastructure, identity tools, and strong support in one ecosystem."
TechBullion Covers CyberYozh's B2B Platform Expansion
"CyberYozh App enables businesses to launch, test, and operate digital products across more than 30 countries through a scalable infrastructure built for global connectivity, verification, and digital operations."
Grit Daily Highlights CyberYozh's Infrastructure for Enterprise Proxy Workloads
"Built for organizations that rely on proxies every day, CyberYozh App delivers infrastructure designed for stability, scalability, and high-volume workloads rather than one-off sessions."
Нас любят data-команды и AI-разработчики
Что говорят те, кто строит на Yozh
Система пресетов — киллер-фича. Передаём имя источника и получаем чистый JSON; самовосстановление даже поймало два изменения вёрстки Amazon раньше нас.
Наконец-то опенсорсный скрейпер, для которого прокси и сессии — первоклассные сущности. Гоняем его за логин-стенами партнёрских порталов — сессии живут, результаты стабильны в разных регионах.
Подключил к Cursor через MCP, и теперь мой агент тянет живые веб-данные прямо посреди задачи. Стриминговый обход по SSE — именно то, чего не хватало агентным сценариям.
Ушли с платного API скрейпинга ради экономии и готовились к откату по качеству — получили обратное. Self-hosted, без оплаты за запрос, а схема вывода чище, чем та, за которую мы платили.
О веб-скрейпинге, краулинге и ИИ-агентах
Блог и статьи
Все статьи
Выделенные мобильные прокси в 2026: Почему UDP и VLESS туннели требуются для преодоления DPI
Системы глубокого анализа пакетов (DPI) активно сканируют и сбрасывают стандартные VPN-соединения. А протоколы OpenVPN и WireGuard отказывают за считанные минуты. Их сразу выдают статические заголовки. Современные…
Лучшая альтернатива Instant Data Scraper в 2026 году
Сравните Instant Data Scraper с CyberYozh и узнайте, когда становятся необходимы масштабируемые краулеры, ротация прокси, геотаргетинг, сессии и автоматизация.
Лучшие мобильные прокси для автоматизации в соцсетях (Reddit, Instagram, TikTok)
Сначала автоматизация в Reddit, Instagram или TikTok работает нормально. Но потом ломается без видимых причин. Платформы помечают аккаунты как подозрительные. Сессии слетают. Охваты падают. И это…
Журнал изменений и обновления веб-скрейпинга
Yozh Scraper — опенсорсный, все обновления доступны на GitHub. Вот последние ключевые изменения.
v0.1.8
fingerprint_profileonPOST /scrape/page,POST /scrape/pagesand the crawler/searchscrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles:auto(default, resolves toCAMOUFOX_FINGERPRINT_PROFILE, shipswindows_on_host),windows_on_host,host,random, and the bare nameswindows/macos/linux. The oldspoof_oskeeps working and equals the three bare names; a caller stating both must not name conflicting operating systems.meta.applied_fingerprintreports what actually ran, including when a profile degraded. New env varsCAMOUFOX_FINGERPRINT_PROFILE(defaultwindows_on_host) andHOST_GPU_VENDOR.- Extraction warns when a
post_processpipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet. - GitHub Actions CI:
pylintandpytest -m "not e2e"on every push and pull request, the checks the repo already defined but never enforced. run_scrapenow returns a typed envelope (ScrapeOk/ScrapeErr) built as the same pydantic models the API validates on the way out, withmypyover the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.session_id,cookiesandrenderare now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed)./searchmaps the rejection to a 400 rather than a 500.
v0.1.7 — Pin mcp<2.0 so a fresh image build starts
mcp2.0.0 madeServer.__init__keyword-only, whichfastapi-mcp0.4.x still calls positionally, so a cleandocker buildshipped services that raisedTypeErrorincreate_app()before serving anything. Bothrequirements.txtandyozh-crawler/requirements.txtnow pinmcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling oncefastapi-mcpships a release built againstmcp2.x.
v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification
- Preset extraction repaired for current site layouts:
- eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
- Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead
urlsfield. - Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
- Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so
From $19.99/Now 19.99parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 — Queue goto-timeout retry fix + dependency security updates
- The queue no longer retries a slow page as if the proxy were bad. A navigation (
goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors,net::ERR_*) still rotate and retry as before. - Dependency bumps clearing the outstanding advisories in the auxiliary tooling:
examples/(langchain-anthropic) and the localscraper-testerdev harness (express,qs,http-proxy-middleware,follow-redirects). No shipped scraper runtime or API change.
v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2
- New required services. Browsers no longer run inside the API process. You must now run the
redisandscraper-workerservices (both are already indocker-compose.yml). Scale capacity withdocker compose up -d --scale scraper-worker=N. POST /scrape/pageand/scrape/pagescan now return503 queue_fullwhen the Redis stream depth exceedsQUEUE_MAXSIZE(previously the in-memory queue was unbounded).- Removed env vars (ignored, warned at startup if set):
JOB_TIMEOUT_MS→ usePAGE_TASK_TIMEOUT_S;JOB_RESULT_MAX→ eviction is now a native Redis TTL (JOB_RESULT_TTL_S);JOBS_ENABLED→ the queue is always on. - New env vars:
REDIS_URL,PAGE_TASK_TIMEOUT_S,LOGIN_TASK_TIMEOUT_S,LOGIN_RESULT_GRACE_S,RECLAIM_IDLE_S,JOB_RESULT_TTL_S,BROWSER_MAX_PAGES,BROWSER_IDLE_SHUTDOWN_S,WARMUP_DWELL_MS. - The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The
web-scrapercontainer only enqueues page tasks and reads results; browsers run in separate, horizontally scalablescraper-workercontainers.
Начните веб-скрейпинг за секунды
Три команды — и у вас работающий скрейпер + краулер с HTTP- и MCP-эндпоинтами.
git clone https://github.com/\ CyberYozh-data/yozh-scraper cd yozh-scraper
cp .env.example .env docker compose up --build
curl -X POST localhost:8000/api/v1/scrape/page \
-H 'Content-Type: application/json' \
-d '{"url":"https://example.com"}'
Связаться с нами
Живой человек читает всё, что приходит. Выберите удобный канал — Telegram самый быстрый.
Готовы скрейпить?
Yozh Crawler + Scraper бесплатны. Навсегда. Поставьте звезду, если помогает — каждая звезда на счету.
Yozh Crawler + Scraper распространяются под лицензией MIT. Используйте. Форкайте. Создавайте на их основе.