在 GitHub 已获得 87 个星标,且数量仍在增加。Yozh Crawler + Scraper 是一款免费、开源且公开开发的工具——如果它能成为您技术栈中的一员,请给我们点个星标

弹性抓取管道:Yozh Scraper 推出 LLM 自愈解析功能

Roman

数据提取是现代人工智能开发、市场情报和竞争分析的基础层。然而,构建可靠的数据管道仍然是一个工程瓶颈。目标网站不断部署结构性变更、A/B 测试和动态混淆手段,导致僵化的提取脚本失效。要解决这种脆弱性问题,网页抓取生态系统需要一次根本性的架构变革。

太长不看版:借助 Yozh Scraper 和 CyberYozh App 扩展数据提取

更新后的 Yozh Scraper 从根本上重新设计了自动化数据采集方式。

  • LLM 自愈解析:在执行过程中修复损坏的 CSS 选择器。
  • 原生 MCP 集成:将 AI 智能体直接连接到网络。
  • 服务器管理的会话:维持对受保护内部配置文件的访问权限。

与 CyberYozh App 搭配使用,可交付纯净的 Markdown 数据集。没有 SaaS 积分倍增机制,没有不可预测的计费。

👉 立即部署您的第一个弹性提取节点

网页数据提取的演变与脆弱性

数据工程团队通常依赖确定性脚本。他们使用精确的 CSS 选择器和 XPath 查询来构建这些脚本。但在解析亚马逊、谷歌或 LinkedIn 等平台时,这些硬编码路径会成为一个巨大的单点故障。React 或 Vue 动态生成新的类名,或者一次微小的前端改版上线,都会立即导致提取模式失效。

目标网站更新其 DOM,管道随即崩溃,数据库空空如也,机器学习也随之停滞。

工程师不得不放下当前的开发任务,手动检查原始 HTML,重写解析规则,部署更新。这种无止境的循环严重损害了生产力,并推高了数据基础设施的总体拥有成本。

Yozh Scraper 与竞争对手对比:Firecrawl、Apify 和 Crawl4AI

行业推出了大量 AI 辅助抓取工具来修复这些失效的管道。但它们往往只是以一个问题换取另一个问题。大多数工具都面临 API 成本不可预测、基础设施配置繁重,或难以与受保护网站保持稳定连接等问题。让我们来看看当前的可选方案。

平台架构模型核心优势战略弱点
FirecrawlREST API SaaS适配 LLM 的 Markdown 输出。内置 MCP 服务器。限制性积分系统。“隐身模式”会使每页成本增加 5 倍。未使用的积分会过期。
Crawl4AI开源 Python 库免费的 Apache 2.0 许可证。快速的异步架构。没有内置代理管理功能。开发者必须从零开始构建自己的网络稳定层。
ScrapeGraphAI提示驱动的提取图将自然语言转化为提取逻辑。与页面布局无关。每页延迟较高。LLM 令牌消耗不可预测。在高流量数据处理场景下表现不佳。
Apify云自动化平台拥有庞大的预构建模块生态系统。调度功能强大。计算单元定价不透明。自定义管道的配置过于复杂。
Bright Data企业级代理与抓取工具超过 7200 万住宅 IP。高合规标准(SOC 2)。过高的最低消费门槛。强势的销售入驻流程阻碍了快速部署。

像 Firecrawl 这样的托管 SaaS 工具最大的陷阱在于稳定访问背后的隐藏成本。一次标准的页面请求只消耗一个积分。但要维持通过 Cloudflare 或 DataDome 的连接呢?这会让你的消耗速度增加五倍。像 Crawl4AI 这样的开源库则恰恰相反:你在软件上省了钱,却要花上数周时间为无头浏览器和轮换代理搭建复杂的服务器集群。

Yozh Scraper 解决了这两种极端情况。它提供开源的可控性,同时配备按需付费的内置代理基础设施。

👉 查看 GitHub 仓库并搭建你自己的本地实例

Yozh Scraper:架构与核心服务

该平台曾名为 Open Scraper,现以基于原生 Playwright 构建的先进双服务架构运行。你不再需要盲目编写原始 JSON 请求体。系统现在包含 Yozh Scraper UI,一个快速的 Node.js 单页应用。

我们将技术基础分布在可扩展的容器中:

  • 爬取服务(端口 8000):运行异步任务 API。它在真实浏览器中渲染 URL,返回精确字段、原始 HTML 和整页截图。
  • 爬虫服务(端口 8001):从单个种子 URL 执行深度站点索引。它管理去重和查询限制,同时通过服务器发送事件(SSE)实时推送统计数据。
  • 可视化测试工具(端口 7000):Web 界面。配置请求参数。可视化测试规则。实时监控大规模提取任务。
Yozh Scraper UI

Yozh Scraper 使用 Taskiq 和 Redis 队列来保证高可用性。主 API 容器仅负责将任务加入队列并读取结果。多个 scraper-worker 容器负责运行 Playwright 实例。由于 Redis 存储了所有任务状态、结果和会话,即使 API 立即重启也不会丢失数据。你永远不会丢失工作负载。而且你可以通过一条简单的 Docker Compose 命令水平扩展浏览器集群。

确保稳定的自动化访问

现代目标网站利用行为分析和 TLS 指纹识别 来阻止自动化请求。Yozh Scraper 在架构层面解决了这个问题。

  • 真实 Chrome 与 Camoufox:它针对复杂目标弃用了内置的 Chromium。取而代之的是,Camoufox 在每次启动时都会生成一个全新的、统计上有效的浏览器指纹(操作系统、GPU、线程数)。
  • WebRTC 泄漏防护:内置的 WebRTC 脚本模拟原生浏览器行为,你的网络踪迹完全受到保护。
  • 服务器端管理上下文:你只需使用声明式 JSON 脚本登录一次。服务器会接管后续流程,记住 Cookie 并锁定代理分配。
  • 即时 Cookie 注入:遇到复杂的验证挑战?可通过 Yozh Scraper UI 将有效的会话 Cookie 直接推送到 API 中,访问权限立即恢复。

引擎核心:Yozh Scraper 中的 LLM 自愈解析

LLM 自愈解析是 Yozh Scraper 的核心。它将硬编码规则的速度与 AI 的适应能力相结合,确保你的数据管道持续运行。

工作流程从标准的 CSS 或 XPath 预设规则开始,这使得常规提取速度快,且完全不消耗 API 令牌。但目标网站会发生变化:前端团队部署了 A/B 测试,页面布局发生偏移,某个必填的 schema 字段返回为空。

爬虫不会因此崩溃,而是回退到 LLM。AI 会读取原始 HTML,分析你所需的输出 schema,即使选择器已失效,也能通过语义定位缺失的数据点并即时提取。你的数据持续流动,无需编写任何手动代码更新,管道停机时间降为零。

启用此功能只需几秒钟。将你的 API 密钥安全地存储在环境文件中,然后只需在 JSON 请求体中追加 llm 对象:

为 AI 训练生成纯净数据集

大语言模型难以处理杂乱、非结构化的 HTML。Yozh Scraper 通过内置的降噪引擎解决了这一问题。

Yozh Scraper fit markdown

只需在请求体中请求 fit_markdown 格式。解析器会立即剔除页眉菜单,去除程序化广告,删除 Cookie 同意横幅。你将得到纯净的、结构化的 Markdown,可直接用于 RAG 管道和模型训练。你终于可以摆脱二次数据清洗微服务了。

通过模型上下文协议(MCP)连接 AI 代理

自主 AI 代理需要结构化端点来浏览网页。开发者通常要浪费数天时间编写自定义中间件,以连接外部 LLM 与本地爬取 API。

Yozh Scraper 通过原生支持模型上下文协议(MCP)消除了这一摩擦。爬取服务和爬虫服务都通过 Streamable HTTP 挂载 MCP 端点。这使得 run_scrape_page、cancel_scrape_job 和 create_crawl 等工具能立即暴露给任何兼容的 AI 环境。

Yozh Scraper MCP

集成只需几秒钟。只需将服务器 URL 添加到你的 Claude Desktop 配置文件中:

连接完成后,AI 会自主浏览网页。你输入:“以深度 2 抓取 example.com,并总结定价页面的内容。”智能体提交任务,轮询异步状态,获取 Markdown 结果。你无需编写任何执行逻辑。

借助 CyberYozh App 生态系统扩展业务

从廉价的数据中心 IP 发送高频请求,几乎必然会导致连接瞬间被切断。为了实现可靠扩展,Yozh Scraper 直接与 CyberYozh App 生态系统集成。

CyberYozh App 是一个强大的网络自动化平台。严格的无日志政策。纯按量付费定价。

可扩展的代理基础设施

  • 移动代理(每日 1.7 美元起):通过真实的 LTE/5G 移动设备路由流量。最大化你的信任评分。安全地管理多个社交账号并访问本地内容。
  • ISP 住宅代理(每月 5.29 美元起):获取与真实家庭网络运营商绑定的静态 IP。为长期电商数据提取维持 99.9% 的正常运行时间和自然的流量模式。
  • 轮换住宅代理(每 GB 0.9 美元起):访问覆盖 195 多个国家、超过 5000 万个动态 IP 的代理池。是大规模价格聚合和稳定自动化注册的最佳选择。

fe.. 👉 浏览 CyberYozh 代理目录,为你的数据管道选择合适的网络

验证与欺诈评估

  • 虚拟号码与实体号码租用一次性短信接收号码(0.02 美元起),或使用高信任度的本地 ISP 号码进行金融科技注册。
  • 虚拟银行卡即时开出令牌化虚拟卡,用于国际 SaaS 订阅和广告网络付款。
  • 欺诈评分检测工具(0.15 美元起):在部署前,查看企业安全系统(如 Stripe、Amazon)如何看待你的数字足迹。检查 IP 滥用频率和 AVS 不匹配情况。

LLM 自愈式解析如何应对网站的动态变化?

硬编码的选择器在 A/B 测试或 DOM 更新时容易失效。Yozh Scraper 首先运行你的确定性解析器。如果某个必需字段为空,内置 AI 会读取原始 HTML,从语义上定位缺失的数据,并即时提取。整个流程零停机。

服务器托管的会话如何维持对受保护账号的稳定访问?

标准的爬虫工具每次请求都会丢弃浏览器上下文,从而触发安全警报。Yozh Scraper 在服务器上维护一个持久化的浏览器会话。你只需通过一个 JSON 脚本进行一次身份验证,服务器会保留 cookies 和代理分配信息。如果遇到验证挑战,你可以直接将预先认证的会话 cookies 注入 API,即时恢复访问权限。

定价模式是怎样的?

Yozh Scraper 及其 Crawler 服务 100% 开源,可免费自行部署。你只需为所使用的代理网络和基础设施付费。CyberYozh App 采用严格的按量付费模式,没有月度最低消费限制。

MCP 集成如何连接 AI 智能体?

Yozh Scraper 挂载了原生的 Model Context Protocol(MCP)端点。将服务器 URL 添加到你的 Claude Desktop 配置中,run_scrape_page 之类的工具就会自动出现,从而让 AI 能够自主浏览和解析目标网站。

它如何为 AI 训练准备数据?

该解析器内置专门的降噪引擎。请求 fit_markdown 格式,系统会自动去除广告、菜单和 cookie 提示条。你得到的是针对 RAG 管道优化过的纯净 Markdown。

CyberYozh App 如何在大规模抓取过程中确保连接稳定?

CyberYozh App 通过合规来源的 ISP 住宅代理池以及真实移动运营商网络(经由 SOCKS5/HTTP 协议)路由你的流量。部署前可使用内置的欺诈评分检测工具评估你的 IP 信誉,从而确保请求具备高信任度。