87 зірок на GitHub, і їхня кількість продовжує зростати. Yozh Crawler + Scraper — це безкоштовний проект з відкритим кодом, який розробляється відкрито. Поставте нам зірку, якщо він заслуговує на місце у вашому стеку.

Впровадження LLM-парсингу з автоналаштуванням у Yozh Scraper

Roman

Збір веб-даних — фундаментальна основа для розробки сучасного штучного інтелекту, маркетингової аналітики та конкурентної розвідки. Однак створення надійних конвеєрів даних залишається головним інженерним викликом. Цільові веб-сайти постійно впроваджують структурні зміни, проводять A/B-тестування та використовують динамічну обфускацію, через що жорсткі скрипти збору даних неминуче ламаються. Для розв’язання цієї проблеми крихкості екосистема веб-скрейпингу потребує фундаментального архітектурного зсуву.

TL;DR: Масштабування парсингу з Yozh Scraper і CyberYozh App

Оновлений Yozh Scraper повністю змінює підхід до автоматизованого збору даних.

  • LLM-парсинг з автоналаштуванням: Виправляє зламані CSS-селектори прямо в процесі виконання завдання.
  • Нативна інтеграція MCP: Дає ІІ-агентам прямий доступ до веб-даних.
  • Серверні сесії: Забезпечує стабільний доступ до закритих профілів.

У зв’язці з інфраструктурою CyberYozh App ви отримуєте чисті датасети у форматі Markdown. Ніяких прихованих множників тарифу. Ніяких сюрпризів у рахунках.

👉 Розгорніть свій перший інстанс уже сьогодні.

Крихкість застарілих парсерів

Зазвичай дата-інженери пишуть скрипти за жорсткими правилами. Вони жорстко прив’язують логіку до конкретних CSS-селекторів та XPath-запитів. І під час збору даних з гігантів на зразок Amazon, Google або LinkedIn такі захардкожені шляхи стають головною точкою відмови. React або Vue на льоту генерує нові імена класів. Фронтенд викочує незначний редизайн. Парсер ламається миттєво.

Цільовий сайт оновлює DOM. Пайплайн падає. База перестає поповнюватися. Ручне налагодження починається.

Інженери відкладають поточні завдання і беруться вручну розбирати сирий HTML. Переписують правила. Розгортають апдейти. Цей бескінечний цикл знижує продуктивність і сильно роздуває бюджет на підтримку інфраструктури.

Порівняння Yozh Scraper з Firecrawl, Apify і Crawl4AI

Індустрія випустила десятки ІІ-скраперів для запуску складних пайплайнів. Але зазвичай вони змінюють одну проблему на іншу. Більшість платформ стикається з непередбачуваними тарифами, тяжким налаштуванням серверів або утриманням сесії на захищених сайтах. Розгляньмо поточні варіанти.

ПлатформаАрхітектураКлючові плюсиОбмеження та недоліки
FirecrawlREST API SaaSВидає чистий Markdown. Має вбудований MCP-сервер.Жорстка система кредитів. Прихований режим спалює в 5 разів більше балансу. Невикористані ліміти згорають.
Crawl4AIOpen-source бібліотека PythonБезплатна ліцензія Apache 2.0. Швидка асинхронна робота.Проста база. Ніякого управління проксі. Підтримка стабільної мережі лягає на ваші плечі. Витрати на залізо ростуть лінійно.
ScrapeGraphAIГраф видобування на основі промптівПереробляє текст у логіку видобування. Ігнорує верстку.Довга обробка сторінок. Непередбачувані витрати токенів. Погано тягне потоковий збір даних.
ApifyПлатформа хмарної автоматизаціїВеличезний вибір готових модулів. Надійний планувальник задач.Заплутаний розрахунок вартості за обчислювальні одиниці. Переускладнене налаштування кастомних задач.
Bright DataКорпоративні проксі та скрапер72М+ резидентських IP. Високі стандарти безпеки (SOC 2).Високий порог входу. Жорсткі фінансові зобов’язання та нав’язливі продажі гальмують старт.

Звичайний парсинг коштує один кредит. Але як тільки потрібно утримати сесію через Cloudflare чи DataDome, витрата бюджету злітає в космос. Відкриті бібліотеки, як Crawl4AI, вводять у іншу крайність. Софт безкоштовний, але команда витрачає тижні на те, щоб піднімати кластери для headless-браузерів і прикручувати ротацію проксі.

Yozh Scraper закриває цю прогалину. Ви отримуєте повний контроль над open-source кодом плюс вбудовану проксі-інфраструктуру з оплатою тільки за чистий трафік.

👉 Перейдіть у репозиторій на GitHub і піднімайте свій локальний інстанс.

Yozh Scraper: Архітектура і базові сервіси

Раніше відомий як Open Scraper, проєкт виріс у просунутий двосервісний стек на основі Playwright. Вам більше не потрібно навсліпу писати сирі JSON-запити. Система включає Yozh Scraper UI — легкий односторінковий застосунок на Node.js.

Ми розподілили базу за ізольованими контейнерами:

  • Сервіс скрапера (Порт 8000): Відповідає за асинхронний API. Рендерить URL у справжньому браузері. Повертає потрібні поля, сирий HTML і повноекранні скриншоти.
  • Сервіс краулера (Порт 8001): Глибоко індексує сайти зі стартової посилання. Сам керує дедуплікацією та лімітами. Віддає статистику в прямому ефірі через Server-Sent Events (SSE).
  • Візуальний тестер (Порт 7000): Зручний веб-інтерфейс. Налаштовуйте параметри. Тестуйте правила глазами. Моніторте масовий парсинг у реальному часі.
Yozh Scraper UI

Для відмовостійкості Yozh Scraper використовує черги Taskiq і Redis. Головний контейнер API лише ставить задачі й забирає результати. Всю чорнову роботу виконують воркери з Playwright. Redis надійно зберігає стан задач, як і сесії. Тому API спокійно переживає перезавантаження без втрати даних. А ви можете масштабувати парк браузерів однією командою Docker Compose.

Стабільний автоматизований доступ

Сучасні сайти блокують автоматичні запити через поведінковий аналіз і TLS-відбитки. Yozh Scraper вирішує цю проблему на рівні архітектури.

  • Справжній Chrome і Camoufox: Для складних цілей система відмовляється від базового Chromium. Camoufox збирає новий фінгерпринт (ОС, GPU, потоки) при кожному запиті на основі реальної статистики.
  • Захист WebRTC: Вбудований скрипт імітує нативну поведінку браузера. Ваш мережевий слід залишається надійно захищеним.
  • Сервер зберігає контекст: Ви логінитеся лише один раз через декларативний JSON-скрипт. Далі працює сервер. Він надійно запам’ятовує куки і прив’язку проксі.
  • Ін’єкція куки на льоту: З’явилася складна перевірка? Прокиньте валідні сесійні куки напряму в API через інтерфейс скрапера. Доступ відновлюється миттєво.

Ядро системи: LLM-парсинг із самовідновленням у Yozh Scraper

Головна сила Yozh Scraper криється в LLM-парсингу із самовідновленням. Механізм поєднує швидкість жорстких правил з адаптивністю нейромережі. Ваші пайплайни працюють без збоїв.

Процес починається зі стандартних пресетів на базі CSS або XPath. Базовий збір даних іде швидко і не витрачає токени API. Але сайти змінюються. Чужа команда викочує новий пакет для A/B-тесту. Обов’язкове поле повертається порожнім.

Замість помилки парсер перемикається на LLM. ШІ читає сирий HTML. Дивиться на потрібну схему виводу. Нейромережа знаходить пропущені дані за змістом і витягує їх на льоту. База продовжує поповнюватися. Вам не потрібно лізти в код і правити селектори. Прості конвеєри зникають.

Увімкнути цей механізм дуже просто. Збережіть ключі API у файлі оточення. Потім додайте об’єкт llm у свій JSON-запит:

{

  "source": "amazon_product",

  "preset_params": {"asin": "B08N5WRWNW"},

  "llm": {"model": "openai/gpt-5.4-mini"}

}

Генерація чистих датасетів для навчання ШІ

Великі мовні моделі губляться в сирому HTML. Yozh Scraper вирішує цю проблему через вбудований фільтр шуму.

Yozh Scraper markdown

Просто передайте формат fit_markdown у своєму запиті. Парсер миттєво виріже навігаційне меню. Вичистить рекламні блоки. Видалить банери зі згодою на куки. На виході ви отримаєте чистий структурований Markdown. Він одразу готовий для навчання моделей і RAG-пайплайнів. Ви можете сміливо відключати свої сторонні мікросервіси для очищення тексту.

Підключення ШІ-агентів через Model Context Protocol (MCP)

Автономним ШІ-агентам потрібні структуровані точки входу для роботи з інтернетом. Зазвичай розробники витрачають дні на те, щоб писати кастомні костилі й пов’язувати зовнішні LLM з локальними API для парсингу.

Yozh Scraper прибирає цю проблему через нативну інтеграцію Model Context Protocol (MCP). Скрапер і краулер миттєво піднімають кінцеві точки MCP через Streamable HTTP. Це відкриває ШІ-середам прямий доступ до інструментів на кшталт run_scrape_page, cancel_scrape_job і create_crawl.

Yozh Scraper MCP

Налаштування займає хвилину. Просто додайте URL-адреси серверів у локальний конфіг вашого Claude Desktop:

{

  "mcpServers": {

    "yozh-scraper": {

      "type": "http",

      "url": "http://localhost:8000/mcp"

    },

    "open-crawler": {

      "type": "http",

      "url": "http://localhost:8001/mcp"

    }

  }

}

Після цього ІІ-агент сам гуляє по інтернету. Ви пишете промпт: «Проскануй example.com на глибину 2 і зроби зведення по цінах». Агент сам ставить задачу. Сам опрацьовує асинхронний статус. Сам забирає готовий Markdown. Ви не пишете жодного рядка пов’язаного коду.

Масштабування операцій з екосистемою CyberYozh App

Відправка великого потоку запитів з дешевих датацентр-адрес гарантує миттєвий обрив зв’язку. Для надійного масштабування Yozh Scraper нативно інтегрований з екосистемою CyberYozh App.

Це комплексна платформа для веб-автоматизації. Сувора політика no-logs. Оплата лише за реальні витрати (pay-as-you-go).

Інфраструктура проксі

  • Мобільні проксі (від $1.7/день): Направляйте трафік через реальні 5G-пристрої. Отримайте максимальний Trust Rate. Керуйте мережами соціальних профілів і безпечно звертайтеся до локального контенту.
  • Статичні резидентські (від $5.29/міс): Зафіксуйте статичну IP-адресу домашнього провайдера. Тримайте аптайм 99,9% і природні паттерни трафіку для довгих сесій в e-commerce.
  • Ротаційні резидентські (від $0.9/1Gb): Задіюйте пул із 50 млн динамічних адрес у 195+ країнах. Оптимально для масового парсингу цін і стабільних автоматичних реєстрацій.

👉 Вивчіть каталог проксі CyberYozh і підберіть мережу під свої задачі.

Верифікація та оцінка профілю

  • Віртуальні та резидентські номери: Орендуйте номери для разових SMS (від $0.02) або використовуйте трастові локальні номери для фінтеху.
  • Віртуальні картки: Миттєво випускайте токенізовані картки для міжнародних оплат, SaaS і рекламних мереж.
  • Оцінка Fraud Score (від $0.15): Дізнайтеся, як системи безпеки (Stripe, Amazon) бачать ваш цифровий слід ще до початку роботи. Перевірте історію IP і валідацію номерів.

Як LLM-парсинг справляється з динамічними змінами сайтів?

Жорсткі селектори ламаються при A/B-тестах або оновленні DOM. Yozh Scraper спершу запускає ваш звичний парсер. Якщо потрібне поле пусте, вбудований ІІ читає вихідний HTML, знаходить дані за змістом і витягує їх на льоту. Процес не зупиняється.

Як серверні сесії забезпечують стабільний доступ до закритих профілів?

Звичайні скрапери втрачають контекст під час кожного запиту, чим викликають підозру систем безпеки. Yozh Scraper тримає постійну сесію на сервері. Ви авторизуєтеся лише один раз через скрипт. Сервер зберігає куки та налаштування проксі. Для складних перевірок ви можете просто передати свіжі сесійні куки в API, щоб миттєво відновити доступ.

Яка модель ціноутворення?

Yozh Scraper, сервіс Crawler і зручний інтерфейс повністю безплатні та відкриті для самостійного хостингу. Ви платите лише за проксі й інфраструктуру, яка вам потрібна. CyberYozh App працює за моделлю pay-as-you-go без щомісячних лімітів.

Як інтеграція MCP допомагає ІІ-агентам?

Yozh Scraper надає кінцеву точку Model Context Protocol (MCP). Додайте URL сервера до конфігурації Claude Desktop, і інструменти, такі як run_scrape_page, з’являться автоматично. ІІ зможе скановати сторінки самостійно.

Як готуються дані для навчання ІІ?

Скрапер включає рушій фільтрації шуму. Запросіть формат fit_markdown, і система сама видалить рекламу, меню й банери. Ви отримаєте чистий структурований Markdown, готовий для RAG-пайплайнів.

Як CyberYozh App забезпечує стабільне з’єднання під час масштабного парсингу?

CyberYozh App спрямовує трафік через трастові пули резидентських ISP та мобільних операторів за протоколами SOCKS5/HTTP. А вбудований чекер Fraud Score дозволяє заздалегідь оцінити репутацію вашої IP-адреси, щоб надсилати запити лише з надійних вузлів.