За одне післяобіддя ми замінили наш внутрішній кластер Playwright на Yozh. Кінцева точка MCP одразу ж інтегрувалася в наш агент Claude — жодного допоміжного коду, а сканер і скрепер просто запрацювали.
Простий веб-скрейпінг
для штучного інтелекту
та людей
Інструмент з відкритим кодом для збору та вилучення даних. Почніть з одного URL-адреси, проскануйте сайт і отримуйте структуровані дані під час завантаження сторінок. Працює з MCP та такими інструментами, як Claude і Cursor, і має готові пресети для торгових майданчиків, таких як Amazon та eBay.
Скануйте веб-сайти повністю та отримуйте дані за один прохід
Yozh Crawler створює карту всієї структури сайту та обробляє сторінки по мірі їх виявлення. Ви отримуєте як повне охоплення, так і корисні результати за один прохід, без необхідності керувати окремими етапами сканування та вилучення даних. Ця функція працює безпосередньо в рамках ваших існуючих робочих процесів збору та вилучення даних.
Yozh Crawler, вбудований NEW
Почніть з одного URL-адреси та проскануйте весь сайт. Сторінки виявляються та обробляються за один прохід, тож ви отримуєте повне охоплення без додаткових кроків.
Режим «Відкриття» NEW
Потрібні лише посилання? Перейдіть у режим сканування та створіть карту сайту без аналізу. Швидше, легше та зручно для аудитів і перевірки структури.
Браузер із режимом прихованого перегляду
Зіставляє заголовки, місцезнаходження та сигнали браузера з вашим проксі-сервером. Допомагає забезпечити узгодженість сеансів у різних регіонах.
Пакетне вилучення даних
Виконуйте сотні URL-адрес в одному запиті. Обробляйте все паралельно, отримуючи єдиний чіткий результат.
Двоступеневе скасування NEW
Призупиніть виконання завдань, не порушуючи результатів. Дозвольте активним сторінкам завершити роботу або миттєво зупиніть усі процеси, коли це потрібно.
Інтеграція MCP
Підключіться безпосередньо до таких інструментів, як Claude та Cursor. Використовуйте скрейпінг та сканування веб-сторінок у рамках ваших існуючих робочих процесів.
10 вбудованих пресетів
Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — передайте назву джерела та параметри, отримайте нормалізовану відповідь. Не потрібно писати селектори.
Функція самовідновлення LLM NEW
Сайт оновив макет, а ваші CSS-селектори повертають порожні результати? Парсер звертається до великої мови (LLM) (OpenAI / Anthropic / Gemini / OpenRouter) з проханням миттєво перегенерувати селектор. Процес продовжує працювати.
Пресети, створені за допомогою штучного інтелекту NEW
Потрібен сайт, для якого у нас немає готового пресета? Опишіть, що потрібно витягти, та вставте зразок URL-адреси — POST /api/v1/presets/generate повертає готовий пресет у форматі JSON.
Сесії з автентифікацією NEW
Увійдіть один раз за допомогою декларативної DSL (goto / fill / click / wait) або вставте експортовані файли cookie. Використовуйте цю сесію під час кожного скрейпінгу. Це необхідно для об’єктів із обмеженим доступом, таких як пресет LinkedIn.
Проста інфраструктура для скрейпінгу, яку ви можете повністю контролювати
Налаштуйте свій робочий процес в одному місці та запускайте його так, як вам потрібно. Все зрозуміло, впорядковано та легко керується без додаткових інструментів.
Вбудовані проксі-сервери, готові до використання
Отримайте доступ до проксі-серверів для домашнього використання, мобільних пристроїв та центрів обробки даних у понад 120 країнах. Понад 50 мільйонів IP-адрес із часом безвідмовної роботи 99,9%. Включає підтримку функції ідентифікації за відбитками (fingerprinting) для узгодження поведінки пристрою, браузера та мережі, що забезпечує стабільність сеансів та кращий контроль.
Гнучке вилучення даних
Використовуйте селектори CSS, XPath або функцію автоматичного виявлення для популярних сайтів. Отримуйте чистий, структурований JSON без складних налаштувань.
Усі дані в одному місці
Отримайте вихідний HTML-код, скріншоти та проаналізовані дані в одному місці. Все, що вам потрібно, без необхідності перемикатися між інструментами.
Просте управління та доступ до MCP
Ви можете в будь-який момент зупинити завдання одним кліком і перемикатися між режимами «скрейпер» та «краулер». Ваш робочий процес залишається простим і повністю під вашим контролем.
Штучний інтелект, призначений для веб-скрейпінгу та веб-сканування
Підключіть Yozh Crawler та Yozh Scraper до Claude, Cursor або будь-якого клієнта MCP. Перемикайте інструменти одним натисканням — додатковий код не потрібен.
Функції веб-скрейпінгу
Усі функції Yozh Scraper доступні у вигляді функцій для вашого агента, включаючи витяг даних, пакетне виконання та створення скріншотів.
Підключення займе одну хвилину
Скопіюйте файл конфігурації, перезапустіть клієнт — і все готово.
Працює з будь-яким клієнтом MCP
«Claude Desktop», «Cursor», «Cline» або власні агенти.
Повний контроль над набором інструментів
Виберіть, як ваш агент буде виконувати завдання: від окремих сторінок до цілих партій.
Зробіть це по-своєму
Використовуйте локальний сервер MCP або розгорніть його у власній інфраструктурі.
// ~/Library/Application Support/Claude/claude_desktop_config.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cursor → Settings → MCP → Add new MCP Server { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cline → MCP Servers → Edit cline_mcp_settings.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp", "disabled": false }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp", "disabled": false } } }
// Anthropic Messages API · MCP via Streamable HTTP // Note: scraper must be reachable from Anthropic's servers (deploy publicly) import Anthropic from "@anthropic-ai/sdk"; const response = await new Anthropic().messages.create({ model: "claude-opus-4-8", mcp_servers: [ { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" }, { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" } ], messages: [...] });
Сканування, потокове завантаження та аналіз сторінок у режимі реального часу
Yozh Crawler починає з одного URL-адреси, виявляє сторінки на всьому сайті та обробляє їх під час завантаження, надаючи вам повну структуру та корисні дані за один прохід.
Пряма трансляція
Сторінки з’являються по мірі їх виявлення та обробки. Переходьте до них безпосередньо з вашого клієнта, агента або конвеєра, не чекаючи на завершення повного циклу обробки.
Режим «Відкриття»
Потрібні лише посилання? Створіть карту сайту без аналізу. Це швидше та економічніше для перевірки структури та аудиту.
Двоступеневе скасування
Безпечно зупиняйте завдання. Дочекайтеся завершення активних сторінок або миттєво зупиніть усі процеси, коли це потрібно.
Перемикач цільового режиму MCP
Перемикайтеся між режимами «скрейпер» і «краулер» одним перемикачем. Ваш агент використовує відповідний інструмент для кожного завдання.
Інтерактивна структура сайту в інтерфейсі користувача
Спостерігайте за побудовою структури сайту в режимі реального часу. Слідкуйте за ходом роботи сторінка за сторінкою, не виходячи з панелі управління.
Result
▶ Site Map (0 pages)
| URL | Parent | Depth | Status | Took |
|---|
Від одного URL-адреси до повного охоплення сайту
Пошуковий робот знаходить сторінки, скрейпер їх обробляє, а ваш агент на базі штучного інтелекту використовує отримані результати — система розроблена як для початківців, так і для експертів.
Гусеничний
Виявляє всі URL-адреси
Yozh Scraper
Витяги у форматі JSON
Штучний інтелект-агент
Аналізує та приймає рішення
Аналіз конкурентного середовища
Відстежуйте каталоги конкурентів, ціни та детальну інформацію про товари в одному місці. Виявляйте прогалини у власних пропозиціях та швидше реагуйте на зміни на ринку.
Моніторинг цін
Автоматично відстежуйте зміни цін на різних торгових майданчиках. Налаштуйте сповіщення та отримуйте повідомлення в Telegram або Slack, коли ціни змінюються.
Дані для навчання ML
Збирайте чисті, структуровані набори даних із відкритих джерел, готові до аналізу або навчання моделей. Розроблено для надійного збору даних у великих обсягах.
Почніть скрейпінг одразу ж, скориставшись готовими пресетами
Локалі, валюти, селектори та захист від ботів — уже налаштовані. Оберіть пресет, щоб побачити, які дані витягуються.
Every Amazon listing, normalized
All fields below are extracted automatically — no selectors to write.
Потрібен сайт, який ми ще не охоплюємо?
Створіть запит на GitHub або поділіться власним пресетом — ми розглядаємо запити на злиття протягом тижня.
Проксі-сервери, створені для веб-скрейпінгу
Три типи, шість конфігурацій. Обирайте залежно від завдань, швидкості та бюджету.
Мобільний зв'язок 4G/5G
Справжні мобільні пристрої в мережах операторів зв’язку. Найвищий рівень надійності з суворими системами захисту від ботів.
Особистий пристрій, ручна зміна IP-адреси через API
Один пристрій — кілька користувачів
Дізнайтеся більше про мобільні проксі-сервери
Як це працює
Кожна IP-адреса належить реальному смартфону або LTE/5G-модему, підключеному до мережі одного з провідних операторів мобільного зв’язку. Цією IP-адресою користуються тисячі звичайних абонентів, тому її блокування призвело б до блокування реальних користувачів — саме тому системи захисту від ботів найбільше довіряють мобільним IP-адресам.
Найкраще підходить для
- Управління акаунтами в соціальних мережах
- Агресивні заходи проти ботів (Cloudflare, PerimeterX)
- Партнерська діяльність та перевірка реклами
- Завдання, що вимагають стабільної «людської» довіри
Технічні характеристики
- Мережі 4G LTE та 5G по всьому світу
- Підтримка протоколу UDP, підключення через VPN VLS
- Ручна зміна IP-адреси через API або посилання на панель управління
- Налаштування «відбитка» ОС
- Необмежена пропускна здатність у більшості тарифних планів
Житловий
IP-адреси реальних домашніх користувачів Інтернету з понад 120 країн. Доступ до понад 50 млн IP-адрес із оптимальним співвідношенням надійності та вартості.
Справжні маршрутизатори, фіксована IP-адреса на весь термін оренди
Пул IP-адрес понад 100 млн, автоматична ротація за таймером або за запитом
Дізнайтеся більше про проксі-сервери для домашнього використання
Як це працює
Побутові IP-адреси отримуються від реальних абонентів домашнього інтернету, які дають згоду на спільне використання пропускної здатності в обмін на винагороду через прозору мережу з добровільною участю. Їхнє підключення виглядає як у будь-якого іншого домашнього користувача — адже це і є домашнє підключення.
Найкраще підходить для
- Масовий веб-скрейпінг (оптимальний варіант)
- Збір даних з торгових майданчиків
- SEO-дослідження, скрейпінг результатів пошуку (SERP)
- Моніторинг брендів та цін
- Кампанії з перевірки реклами
Технічні характеристики
- Понад 120 країн, понад 100 млн унікальних IP-адрес у пулі з ротацією
- Можливість вибору між статичним та ротаційним режимом залежно від завдання
- Доступне таргетування за містом та ASN
- Підтримка протоколів HTTPS та SOCKS5
- Фіксовані сесії тривалістю до 30 хвилин
Центр обробки даних
Максимальна швидкість, мінімальні витрати. Понад 2 млн IP-адрес у дата-центрах по всьому світу.
Один IP-адреса, виділена саме вам, необмежений трафік
Спільний пул — економічний варіант для простих завдань
Дізнайтеся більше про проксі-сервери Datacenter
Як це працює
IP-адреси розміщуються в дата-центрах і не підключені до домашніх або мобільних користувачів. Вони дешевші та швидші за домашні, але системи захисту від ботів можуть розпізнавати їх як нелюдські, тому використовуйте їх там, де рівень довіри не має вирішального значення.
Найкраще підходить для
- Масове сканування дружніх сайтів
- Розробка внутрішніх інструментів та навантажувальне тестування
- Кінцеві точки API без фільтрів довіри до IP-адрес
- Завдання, в яких швидкість важливіша за маскування
Технічні характеристики
- Понад 2 млн IPv4- та IPv6-адрес
- Виділені або спільні конфігурації
- Необмежена пропускна здатність у виділених тарифних планах
- Підтримка протоколів HTTPS та SOCKS5
- Найнижча затримка серед усіх трьох типів
Етика є невід’ємною частиною того, як ми керуємо нашою платформою
Відкритий код — це лише відправна точка. Не менш важливе значення має те, як збираються дані та звідки беруться проксі-сервери. Це стандарти, яких ми дотримуємося на практиці, а не просто слова на сторінці.
Етичний збір даних
Ми створюємо інструменти, а не лазівки. Yozh Scraper розроблено для того, щоб забезпечити надійне вилучення законних відкритих даних — а не для того, щоб порушувати цілісність того, що має залишатися закритим.
- Тільки загальнодоступні дані — за замовчуванням заборонено збирання даних користувачами, що увійшли в систему
- Вбудовані обмеження швидкості запобігають перевантаженню сервера
- За замовчуванням дотримуються файли robots.txt та sitemap (можливе перевизначення)
- Збір та зберігання персональних даних не здійснюється — ні нами, ні за замовчуванням для користувачів
- Інструменти, які допоможуть вам забезпечити відповідність вимогам GDPR та CCPA
Прозора мережа проксі-серверів
Походження IP-адрес для домашнього використання є випробуванням на чесність для кожного провайдера проксі-серверів. Ось звідки саме походять наші адреси — ми чітко зазначаємо це:
- Мережа за принципом добровільної участі. Справжні користувачі дають згоду та заробляють, надаючи частину своєї пропускної здатності
- Відмова від розсилки одним кліком у будь-який час, без зайвих запитань
- Перевірений ланцюг постачання з документально підтвердженими джерелами постачання
- Жодного шкідливого програмного забезпечення, жодного прихованого вбудовування SDK — ніколи
- Адреси Mobile IP з пристроїв, які нам належать і якими ми керуємо, а не зі зламаних мобільних телефонів
Швидке реагування на випадки зловживання
Якщо хтось зловживає нашою інфраструктурою, щоб завдати шкоди іншим, ми хочемо про це дізнатися — і вжити заходів, перш ніж ситуація погіршиться.
- Прямий зв’язок із реальною людиною, а не черга на обробку запитів
- Прозорий процес розслідування кожного обґрунтованого повідомлення
- Активна співпраця з правоохоронними органами щодо підтверджених випадків
- Публічна політика щодо зловживань, викладена не дрібним шрифтом
Якщо сценарій використання передбачає зловживання або заподіяння шкоди, наші інструменти не призначені для цього. Ми ставимо відповідальне використання вище, ніж зростання кількості клієнтів.
Якщо певний випадок використання вимагає приховування особи для заподіяння шкоди іншим, наші інструменти для цього не призначені. Крапка. Ми краще втратимо клієнта, ніж відступимо від своїх принципів.
Наші політики та стандарти
Чіткі правила, що визначають нашу діяльність — від збору даних до пошуку представників та використання платформи. Це саме ті політики, яких дотримується наша команда, а не їхні короткі виклади.
Політика використання
Визначає, що дозволено на нашій інфраструктурі, а що обмежено, із чітким обґрунтуванням.
Політика реагування на зловживання
Пояснює, як звернення розглядаються, обробляються та вирішуються, включно з термінами реагування.
Стандарти формування мережі
Описує, як отримуються резидентні та мобільні IP, із моделлю opt-in і перевіреним постачанням.
Політика верифікації клієнтів
Охоплює онбординг, випадки, коли потрібна верифікація, та як обробляються дані користувачів.
Обмежені цілі
Перелічує заблоковані домени й сценарії використання, включно з чутливими секторами, як-от державний сектор і фінанси.
Політика обробки даних
Пояснює, які дані збираються, що не зберігається, обмеження щодо зберігання та передавання третім сторонам.
Як команди використовують
дані CyberYozh
Впровадження в реальних умовах
Веб-скрейпінг та аналітика
Автоматизуйте збір великих обсягів відкритих даних: каталоги товарів, рейтинги, відгуки, геодані. Yozh Scraper у поєднанні з проксі-серверами для приватного використання — легально, стабільно та без спаму.
Дізнатися більше
Штучний інтелект та автоматизація
Створюйте автономні агенти, які збирають дані, аналізують їх і виконують дії. Завдяки інтеграції з MCP Yozh Scraper стає вбудованим інструментом для Claude та Cursor — додаткова інтеграція не потрібна.
Дізнатися більше
Електронна комерція та торгові майданчики
Відстежуйте ціни, запаси та наявність товарів на Amazon, eBay та інших світових торгових майданчиках. Готові налаштування дозволяють заощадити тижні розробки.
Дізнатися більшеЩо кажуть ЗМІ та підприємства
Об’єктивні висновки з незалежних джерел
Усі статті
AFFMaven Reviews CyberYozh's Proxy & Multi-Accounting Platform
"CyberYozh stands out as a powerful platform for affiliates and arbitrage teams, combining reliable proxy infrastructure, identity tools, and strong support in one ecosystem."
TechBullion Covers CyberYozh's B2B Platform Expansion
"CyberYozh App enables businesses to launch, test, and operate digital products across more than 30 countries through a scalable infrastructure built for global connectivity, verification, and digital operations."
Grit Daily Highlights CyberYozh's Infrastructure for Enterprise Proxy Workloads
"Built for organizations that rely on proxies every day, CyberYozh App delivers infrastructure designed for stability, scalability, and high-volume workloads rather than one-off sessions."
Нас люблять data-команди та AI-розробники
Що кажуть люди, які створюють проекти за допомогою Yozh
Система пресетів — це головна фішка. Ми передаємо назву джерела й отримуємо у відповідь чистий JSON; функція автоматичного відновлення навіть встигла виявити дві зміни у макеті Amazon ще до того, як ми їх помітили.
Нарешті з’явився скрейпер з відкритим кодом, який розглядає проксі-сервери та сесії як повноцінні компоненти. Ми використовуємо його для доступу до партнерських порталів, що вимагають авторизації — сесії зберігаються, а результати залишаються однаковими в усіх регіонах.
Підключив його до Cursor через MCP, і тепер мій агент отримує веб-дані в режимі реального часу під час виконання завдання. Потокове сканування через SSE — це саме те, чого бракувало робочим процесам агента.
Ми відмовилися від платного API для зчитування даних, щоб скоротити витрати, і готувалися до погіршення якості — але отримали зовсім протилежний результат. Сервіс розміщений на власному хостингу, оплата не стягується за кожен запит, а схема вихідних даних є чіткішою, ніж та, за яку ми раніше платили.
Про веб-скрейпінг, веб-сканування та агенти на основі штучного інтелекту
Блог та статті
Усі статті
Виділені мобільні проксі у 2026: чому потрібні тунелі UDP і VLESS для подолання DPI
Системи глибокого аналізу пакетів (DPI) активно скановано і зупиняють стандартні VPN-з’єднання. А протоколи OpenVPN і WireGuard викривають себе за лічені хвилини. Їхню сутність видають статичні заголовки.…
Найкраща альтернатива Instant Data Scraper у 2026 році
Порівняйте Instant Data Scraper із CyberYozh і дізнайтеся, коли стають необхідними масштабовані краулери, ротація проксі, геотаргетинг, сесії та автоматизація.
Найкращі мобільні проксі для автоматизації соцмереж (Reddit, Instagram, TikTok)
Автоматизація в Reddit, Instagram чи TikTok часто працює спочатку добре, а потім починає давати збої без очевидної причини. Акаунти отримують позначки, сесії скидаються, охоплення падає, хоча…
Журнал змін та оновлення щодо веб-скрейпінгу
Yozh Scraper — це проект з відкритим кодом, усі оновлення якого доступні на GitHub. Ось найважливіші новинки.
v0.1.8
fingerprint_profileonPOST /scrape/page,POST /scrape/pagesand the crawler/searchscrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles:auto(default, resolves toCAMOUFOX_FINGERPRINT_PROFILE, shipswindows_on_host),windows_on_host,host,random, and the bare nameswindows/macos/linux. The oldspoof_oskeeps working and equals the three bare names; a caller stating both must not name conflicting operating systems.meta.applied_fingerprintreports what actually ran, including when a profile degraded. New env varsCAMOUFOX_FINGERPRINT_PROFILE(defaultwindows_on_host) andHOST_GPU_VENDOR.- Extraction warns when a
post_processpipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet. - GitHub Actions CI:
pylintandpytest -m "not e2e"on every push and pull request, the checks the repo already defined but never enforced. run_scrapenow returns a typed envelope (ScrapeOk/ScrapeErr) built as the same pydantic models the API validates on the way out, withmypyover the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.session_id,cookiesandrenderare now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed)./searchmaps the rejection to a 400 rather than a 500.
v0.1.7 — Pin mcp<2.0 so a fresh image build starts
mcp2.0.0 madeServer.__init__keyword-only, whichfastapi-mcp0.4.x still calls positionally, so a cleandocker buildshipped services that raisedTypeErrorincreate_app()before serving anything. Bothrequirements.txtandyozh-crawler/requirements.txtnow pinmcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling oncefastapi-mcpships a release built againstmcp2.x.
v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification
- Preset extraction repaired for current site layouts:
- eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
- Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead
urlsfield. - Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
- Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so
From $19.99/Now 19.99parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 — Queue goto-timeout retry fix + dependency security updates
- The queue no longer retries a slow page as if the proxy were bad. A navigation (
goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors,net::ERR_*) still rotate and retry as before. - Dependency bumps clearing the outstanding advisories in the auxiliary tooling:
examples/(langchain-anthropic) and the localscraper-testerdev harness (express,qs,http-proxy-middleware,follow-redirects). No shipped scraper runtime or API change.
v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2
- New required services. Browsers no longer run inside the API process. You must now run the
redisandscraper-workerservices (both are already indocker-compose.yml). Scale capacity withdocker compose up -d --scale scraper-worker=N. POST /scrape/pageand/scrape/pagescan now return503 queue_fullwhen the Redis stream depth exceedsQUEUE_MAXSIZE(previously the in-memory queue was unbounded).- Removed env vars (ignored, warned at startup if set):
JOB_TIMEOUT_MS→ usePAGE_TASK_TIMEOUT_S;JOB_RESULT_MAX→ eviction is now a native Redis TTL (JOB_RESULT_TTL_S);JOBS_ENABLED→ the queue is always on. - New env vars:
REDIS_URL,PAGE_TASK_TIMEOUT_S,LOGIN_TASK_TIMEOUT_S,LOGIN_RESULT_GRACE_S,RECLAIM_IDLE_S,JOB_RESULT_TTL_S,BROWSER_MAX_PAGES,BROWSER_IDLE_SHUTDOWN_S,WARMUP_DWELL_MS. - The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The
web-scrapercontainer only enqueues page tasks and reads results; browsers run in separate, horizontally scalablescraper-workercontainers.
Почніть працювати з веб-скрейпінгом за лічені секунди
Три команди — і у вас вже працює скрейпер + краулер з кінцевими точками HTTP та MCP.
git clone https://github.com/\ CyberYozh-data/yozh-scraper cd yozh-scraper
cp .env.example .env docker compose up --build
curl -X POST localhost:8000/api/v1/scrape/page \
-H 'Content-Type: application/json' \
-d '{"url":"https://example.com"}'
Зв’яжіться з нами
Справжня людина читає все, що надходить. Оберіть зручний для вас канал — Telegram працює найшвидше.
Готові до скребкування?
Yozh Crawler + Scraper — це безкоштовна програма. Назавжди. Поставте нам зірочку, якщо вона вам допомогла — кожна зірочка має значення.
Yozh Crawler + Scraper розповсюджується за ліцензією MIT. Користуйтеся ним. Створюйте форки. Розробляйте на його основі.