84 sao trên GitHub và con số này vẫn đang tiếp tục tăng. Yozh Crawler + Scraper là phần mềm miễn phí, mã nguồn mở và được phát triển công khai — hãy nhấn sao cho chúng tôi nếu công cụ này xứng đáng có một vị trí trong hệ thống công nghệ của bạn.
Phiên bản v0.1.8 · Yozh Crawler đã ra mắt

Trích xuất
dữ liệu web dễ dàng cho các tác nhân
AI và con người

Một công cụ mã nguồn mở dùng để thu thập và trích xuất dữ liệu. Bắt đầu từ một URL duy nhất, quét trang web và thu thập dữ liệu có cấu trúc khi các trang được tải. Tương thích với MCP và các công cụ như Claude và Cursor, kèm theo các cài đặt sẵn dành cho các sàn thương mại điện tử như Amazon và eBay.

84 Số sao trên GitHub
MIT Giấy phép · Miễn phí vĩnh viễn
v0.1.8 Phiên bản mới nhất
Open Scraper Tester
Scraper URL http://localhost:8000 Check ok Crawler URL http://localhost:8001 Check ok CyberYozh API Docs ↗ Get API Key ↗
Scrape Page
Batch Scrape
Crawler
Jobs
MCP
Crawl Parameters
Seed URL *
Scope Mode
same-domain
Max Depth
3
Max Pages
47
Per-domain RPS
1.0
Per-domain
1
Include Patterns (regex, one per line)
^https://amazon\.co\.uk/dp/
Exclude Patterns (regex, one per line)
/cart|/account|/checkout
Crawl Proxy⚠ crawl proxy=none — no IP rotation
Proxy Type
none
Enable scraping (keep raw_html / screenshot / extracted data per page)
Result
crawl_________________ · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0
Crawl progress and pages will appear here...
Có gì mới · phiên bản v0.1.8

Quét toàn bộ trang web và thu thập dữ liệu chỉ trong một lần chạy

Yozh Crawler lập bản đồ toàn bộ cấu trúc trang web và xử lý các trang ngay khi phát hiện chúng. Bạn sẽ nhận được cả phạm vi quét và kết quả có thể sử dụng chỉ trong một lần chạy, mà không cần phải quản lý các bước thu thập dữ liệu và trích xuất riêng biệt. Công cụ này hoạt động trực tiếp trong các quy trình thu thập dữ liệu và trích xuất hiện có của bạn.

Yozh Crawler, tích hợp NEW

Bắt đầu từ một URL và lập bản đồ toàn bộ trang web. Các trang được phát hiện và xử lý trong một lần chạy duy nhất, nhờ đó bạn có được phạm vi bao quát toàn diện mà không cần thực hiện thêm bất kỳ bước nào.

Chế độ Khám phá NEW

Chỉ cần các liên kết? Hãy chuyển sang chế độ khám phá và lập bản đồ trang web mà không cần phân tích cú pháp. Nhanh hơn, nhẹ hơn và hữu ích cho việc kiểm toán và kiểm tra cấu trúc.

Trình duyệt ẩn danh

So khớp các tiêu đề, vị trí và tín hiệu trình duyệt với máy chủ proxy của bạn. Giúp duy trì tính nhất quán của các phiên trên các khu vực khác nhau.

Trích xuất dữ liệu theo lô

Chạy hàng trăm URL trong một yêu cầu. Xử lý tất cả song song và trả về một kết quả duy nhất.

Hủy hai giai đoạn NEW

Tạm dừng các tác vụ mà không làm gián đoạn kết quả. Cho phép các trang đang hoạt động hoàn tất hoặc dừng mọi thứ ngay lập tức khi cần thiết.

Tích hợp MCP

Kết nối trực tiếp với các công cụ như Claude và Cursor. Tích hợp các kỹ thuật trích xuất dữ liệu và thu thập dữ liệu vào quy trình làm việc hiện tại của bạn.

10 cài đặt sẵn tích hợp sẵn

Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — chỉ cần truyền tên nguồn và các tham số, bạn sẽ nhận được phản hồi đã được chuẩn hóa. Không cần phải viết các selector.

Khả năng tự phục hồi của LLM NEW

Một trang web triển khai thay đổi bố cục và các bộ chọn CSS của bạn trả về kết quả trống? Trình phân tích cú pháp sẽ yêu cầu một mô hình ngôn ngữ lớn (LLM) (OpenAI / Anthropic / Gemini / OpenRouter) tái tạo bộ chọn ngay lập tức. Quy trình xử lý vẫn tiếp tục chạy.

Các cài đặt sẵn do AI tạo ra NEW

Bạn cần một trang web mà chúng tôi chưa cung cấp cài đặt sẵn? Hãy mô tả nội dung cần trích xuất và dán một URL mẫu vào — POST /api/v1/presets/generate sẽ trả về một preset JSON đã sẵn sàng.

Các phiên đã được xác thực NEW

Đăng nhập một lần thông qua ngôn ngữ kịch bản khai báo (goto / fill / click / wait) hoặc dán các tệp cookie đã xuất. Tái sử dụng phiên đăng nhập này trong mỗi lần thu thập dữ liệu. Yêu cầu bắt buộc đối với các mục tiêu có tường lửa như cài đặt sẵn LinkedIn.

Giao diện

Hệ thống thu thập dữ liệu đơn giản do chính bạn kiểm soát

Thiết lập quy trình làm việc của bạn tại một nơi duy nhất và vận hành theo cách bạn cần. Mọi thứ đều rõ ràng, có hệ thống và dễ quản lý mà không cần đến các công cụ bổ sung.

1

Các máy chủ proxy tích hợp sẵn, sẵn sàng sử dụng

Truy cập các proxy dân dụng, di động và trung tâm dữ liệu tại hơn 120 quốc gia. Hơn 50 triệu địa chỉ IP với thời gian hoạt động 99,9%. Bao gồm tính năng nhận dạng dấu vân tay để đồng bộ hóa hành vi của thiết bị, trình duyệt và mạng, nhằm đảm bảo các phiên kết nối ổn định và khả năng kiểm soát tốt hơn.

2

Trích xuất dữ liệu linh hoạt

Sử dụng các bộ chọn CSS, XPath hoặc tính năng tự động phát hiện cho các trang web phổ biến. Nhận dữ liệu JSON gọn gàng, có cấu trúc mà không cần thiết lập phức tạp.

3

Tất cả dữ liệu được tập trung tại một nơi

Tải về mã HTML thô, ảnh chụp màn hình và dữ liệu đã được phân tích cùng một lúc. Tất cả những gì bạn cần, mà không cần phải chuyển đổi giữa các công cụ.

4

Điều khiển đơn giản và quyền truy cập MCP

Dừng các tác vụ bất cứ lúc nào chỉ với một cú nhấp chuột và chuyển đổi giữa chế độ scraper và crawler. Quy trình làm việc của bạn vẫn đơn giản và hoàn toàn nằm trong tầm kiểm soát của bạn.

MCP · Giao thức bối cảnh mô hình

Các tác nhân AI được phát triển để thu thập và quét dữ liệu trên web

Kết nối Yozh Crawler và Yozh Scraper với Claude, Cursor hoặc bất kỳ ứng dụng khách MCP nào. Chuyển đổi công cụ chỉ bằng một nút gạt, không cần thêm mã.

Các tính năng thu thập dữ liệu từ web

Tất cả các tính năng của Yozh Scraper đều có sẵn dưới dạng các hàm cho agent của bạn, bao gồm trích xuất dữ liệu, chạy theo lô và chụp ảnh màn hình.

Chỉ mất một phút để kết nối

Sao chép tệp cấu hình, khởi động lại ứng dụng khách của bạn, và thế là xong.

Hoạt động với bất kỳ máy khách MCP nào

Claude Desktop, Cursor, Cline hoặc các tác nhân tùy chỉnh.

Kiểm soát hoàn toàn bộ công cụ

Chọn cách thức mà tác nhân của bạn thực thi các tác vụ, từ từng trang riêng lẻ đến toàn bộ lô tác vụ.

Hãy thực hiện theo cách của bạn

Sử dụng máy chủ MCP tại địa phương hoặc triển khai nó trên hạ tầng của riêng bạn.

// ~/Library/Application Support/Claude/claude_desktop_config.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cursor → Settings → MCP → Add new MCP Server
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cline → MCP Servers → Edit cline_mcp_settings.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp",
      "disabled": false
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp",
      "disabled": false
    }
  }
}
// Anthropic Messages API · MCP via Streamable HTTP
// Note: scraper must be reachable from Anthropic's servers (deploy publicly)
import Anthropic from "@anthropic-ai/sdk";

const response = await new Anthropic().messages.create({
  model: "claude-opus-4-8",
  mcp_servers: [
    { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" },
    { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" }
  ],
  messages: [...]
});
Hướng dẫn tích hợp MCP đầy đủ
Yozh Crawler · phiên bản v0.1.8

Truy cập, truyền phát và phân tích các trang web theo thời gian thực

Yozh Crawler bắt đầu từ một URL, phát hiện các trang trên toàn bộ trang web và xử lý chúng ngay khi chúng được tải, mang đến cho bạn cấu trúc đầy đủ và dữ liệu có thể sử dụng chỉ trong một lần chạy.

Phát trực tiếp

Các trang sẽ hiển thị ngay khi được phát hiện và xử lý. Bạn có thể truy cập trực tiếp từ khách hàng, đại lý hoặc quy trình làm việc của mình mà không cần đợi quá trình xử lý hoàn tất.

Chế độ Khám phá

Chỉ cần các liên kết? Tạo sơ đồ trang web mà không cần phân tích cú pháp. Nhanh hơn và tiết kiệm chi phí hơn khi kiểm tra cấu trúc và thực hiện kiểm toán.

Hủy hai giai đoạn

Dừng các tác vụ một cách an toàn. Hãy để các trang đang hoạt động hoàn tất hoặc dừng mọi thứ ngay lập tức khi cần thiết.

Công tắc mục tiêu MCP

Chuyển đổi giữa chế độ scraper và crawler chỉ bằng một nút gạt. Trình tự động của bạn sẽ sử dụng công cụ phù hợp cho từng tác vụ.

Cây trang web trực tiếp trên giao diện người dùng

Theo dõi quá trình xây dựng cấu trúc trang web theo thời gian thực. Theo dõi tiến độ từng trang một mà không cần rời khỏi bảng điều khiển.

Result

crawl_a8f3c124b6e0d7 · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0 · out-of-scope: 0 · retries: 0
Site Map (0 pages)

                    
URL Parent Depth Status Took
Gói combo · Máy thu thập dữ liệu + Máy trích xuất dữ liệu

Từ một URL đến phạm vi bao quát toàn bộ trang web

Trình thu thập dữ liệu tìm kiếm các trang web, trình trích xuất dữ liệu xử lý chúng, và trợ lý AI của bạn sẽ sử dụng kết quả thu được — được thiết kế dành cho cả người mới bắt đầu lẫn chuyên gia.

Xe bò

Tìm tất cả các URL

Yozh Scraper

Trích xuất sang JSON

Trợ lý AI

Phân tích và ra quyết định

Phân tích cạnh tranh

Theo dõi danh mục sản phẩm, giá cả và thông tin chi tiết về sản phẩm của các đối thủ cạnh tranh tại một nơi duy nhất. Phát hiện những điểm còn thiếu sót trong danh mục sản phẩm của chính bạn và phản ứng nhanh hơn trước những thay đổi của thị trường.

Crawler JSON Trí tuệ nhân tạo

Theo dõi giá cả

Tự động theo dõi biến động giá trên các sàn thương mại điện tử. Thiết lập cảnh báo và nhận thông báo qua Telegram hoặc Slack khi giá có biến động.

Xử lý hàng loạt Lịch trình Thông báo

Dữ liệu huấn luyện ML

Thu thập các bộ dữ liệu sạch, có cấu trúc từ các nguồn công khai, sẵn sàng để phân tích hoặc huấn luyện mô hình. Được thiết kế để thu thập dữ liệu đáng tin cậy trên quy mô lớn.

Stealth Proxy JSON
Cài đặt sẵn cho Marketplace và trang web

Bắt đầu trích xuất dữ liệu ngay lập tức với các cài đặt sẵn có thể sử dụng ngay

Cài đặt vùng, đơn vị tiền tệ, bộ lọc và cơ chế chống bot — đã được cấu hình sẵn. Hãy chọn một cài đặt sẵn để xem những thông tin nào sẽ được trích xuất.

10 cài đặt sẵn tích hợp sẵn · LLM tự khắc phục khi bố cục trang web thay đổi · tạo cài đặt sẵn của riêng bạn từ một URL mẫu Yêu cầu cài đặt sẵn →

            

Every Amazon listing, normalized

All fields below are extracted automatically — no selectors to write.

Bạn cần một trang web mà chúng tôi chưa đề cập đến?

Hãy tạo một vấn đề trên GitHub hoặc đóng góp cài đặt sẵn của riêng bạn — chúng tôi sẽ xem xét các yêu cầu kéo (PR) trong vòng một tuần.

Tạo một vấn đề
Máy chủ proxy

Các máy chủ proxy được thiết kế để thu thập dữ liệu

Ba loại, sáu cấu hình. Hãy lựa chọn dựa trên công việc, tốc độ và ngân sách.

Di động 4G/5G

Các thiết bị di động thực tế trên mạng của các nhà mạng. Mức độ tin cậy cao nhất với hệ thống chống bot nghiêm ngặt.

Riêng tư và chuyên dụng from $1.7/day

Thiết bị cá nhân, xoay vòng địa chỉ IP thủ công qua API

Được chia sẻ from $0.9/day

Một thiết bị, nhiều người dùng

Tìm hiểu thêm về proxy di động
Cách thức hoạt động

Mỗi địa chỉ IP đều xuất phát từ một chiếc điện thoại thông minh thực tế hoặc một modem LTE/5G được kết nối với một nhà mạng di động lớn. Địa chỉ IP này được chia sẻ bởi hàng nghìn thuê bao thường xuyên, do đó việc chặn địa chỉ IP này đồng nghĩa với việc chặn cả những người dùng thực — đó chính là lý do tại sao các hệ thống chống bot tin tưởng vào địa chỉ IP di động nhất.

Phù hợp nhất cho
  • Quản lý tài khoản trên các nền tảng mạng xã hội
  • Các biện pháp chống bot mạnh mẽ (Cloudflare, PerimeterX)
  • Hoạt động liên kết và xác minh quảng cáo
  • Các nhiệm vụ đòi hỏi sự tin cậy “giống con người” một cách bền vững
Thông số kỹ thuật
  • Mạng 4G LTE và 5G trên toàn thế giới
  • Hỗ trợ UDP, kết nối VPN VLS
  • Chuyển đổi địa chỉ IP thủ công qua API hoặc liên kết trên bảng điều khiển
  • Điều chỉnh dấu vân tay hệ điều hành
  • Băng thông không giới hạn trên hầu hết các gói cước

Trung tâm dữ liệu

Tốc độ tối đa, chi phí tối thiểu. Hơn 2 triệu địa chỉ IP tại các trung tâm dữ liệu trên toàn thế giới.

Tĩnh chuyên dụng from $1.9/mo

Một địa chỉ IP được cấp cho bạn, lưu lượng truy cập không giới hạn

Tĩnh chia sẻ from $0.5/mo

Bể chung – giải pháp tiết kiệm chi phí cho các công việc đơn giản

Tìm hiểu thêm về các máy chủ proxy trung tâm dữ liệu
Cách thức hoạt động

Các địa chỉ IP này được lưu trữ tại các trung tâm dữ liệu, không kết nối trực tiếp với người dùng tại nhà hay người dùng di động. Chúng rẻ hơn và nhanh hơn so với các địa chỉ IP dành cho hộ gia đình, nhưng các hệ thống chống bot có thể nhận diện chúng là không phải do con người điều khiển, vì vậy hãy sử dụng chúng trong những trường hợp mà yếu tố tin cậy không phải là vấn đề then chốt.

Phù hợp nhất cho
  • Trích xuất dữ liệu với khối lượng lớn từ các trang web thân thiện
  • Công cụ nội bộ và thử nghiệm tải
  • Các điểm cuối API không có bộ lọc tin cậy IP
  • Các tác vụ mà tốc độ quan trọng hơn việc ngụy trang
Thông số kỹ thuật
  • Hơn 2 triệu địa chỉ IPv4 và IPv6
  • Cấu hình chuyên dụng hoặc chia sẻ
  • Băng thông không giới hạn trên các gói chuyên dụng
  • Hỗ trợ các giao thức HTTPS, SOCKS5
  • Độ trễ thấp nhất trong cả ba loại
Chọn máy chủ proxy phù hợp với nhu cầu của bạn → Yêu cầu đăng nhập
Đạo đức · Không thể thỏa hiệp

Đạo đức là một phần không thể tách rời trong cách chúng tôi vận hành nền tảng của mình

Mã nguồn mở chỉ là điểm khởi đầu. Cách thu thập dữ liệu và cách tìm nguồn cung cấp máy chủ proxy cũng quan trọng không kém. Đây là những tiêu chuẩn mà chúng tôi tuân thủ trong thực tế, chứ không chỉ là những tuyên bố trên trang web.

Thu thập dữ liệu tuân thủ đạo đức

Chúng tôi phát triển các công cụ, chứ không phải các lỗ hổng. Yozh Scraper được thiết kế để đảm bảo việc trích xuất dữ liệu công khai một cách hợp pháp diễn ra đáng tin cậy — chứ không phải để xâm phạm những thông tin cần được bảo mật.

  • Chỉ dữ liệu công khai — theo mặc định, không cho phép thu thập dữ liệu khi đã đăng nhập
  • Các giới hạn tốc độ tích hợp sẵn giúp ngăn chặn tình trạng quá tải máy chủ
  • Mặc định tuân thủ robots.txt và sơ đồ trang web (có thể thay đổi)
  • Không thu thập hay lưu trữ thông tin nhận dạng cá nhân (PII) — cả từ phía chúng tôi lẫn theo mặc định đối với người dùng
  • Các công cụ giúp bạn tuân thủ các quy định của GDPR và CCPA

Mạng proxy trong suốt

Nguồn gốc của các địa chỉ IP dân dụng chính là thước đo độ trung thực đối với mọi nhà cung cấp dịch vụ proxy. Dưới đây là nguồn gốc cụ thể của các địa chỉ IP của chúng tôi — được nêu rõ ràng như sau:

  • Mạng lưới tham gia tự nguyện. Người dùng thực sự đồng ý và kiếm tiền khi chia sẻ băng thông
  • Hủy đăng ký chỉ với một cú nhấp chuột bất cứ lúc nào, không cần giải thích lý do
  • Chuỗi cung ứng đã được kiểm toán với quy trình tìm nguồn cung ứng được ghi chép đầy đủ
  • Hoàn toàn không có phần mềm độc hại, hoàn toàn không có việc chèn SDK ẩn — chưa từng xảy ra
  • Các địa chỉ IP di động từ các thiết bị do chúng tôi sở hữu và vận hành, chứ không phải từ các điện thoại di động đã bị xâm nhập

Phản ứng nhanh chóng trước các hành vi lạm dụng

Nếu có ai đó lạm dụng cơ sở hạ tầng của chúng tôi để gây hại cho người khác, chúng tôi muốn biết — và sẽ có biện pháp xử lý trước khi tình hình trở nên tồi tệ hơn.

  • Đường dây trực tiếp đến nhân viên thực sự, không phải hệ thống xếp hàng qua phiếu yêu cầu
  • Quy trình điều tra minh bạch đối với mọi báo cáo hợp lệ
  • Hợp tác tích cực với các cơ quan thực thi pháp luật trong các trường hợp đã được xác nhận
  • Chính sách về lạm dụng công khai, không bị giấu trong những dòng chữ nhỏ li ti
abuse-reports@cyberyozh.com
Average response time: 45 phút

Nếu một trường hợp sử dụng liên quan đến việc lạm dụng hoặc gây hại, các công cụ của chúng tôi không được thiết kế để phục vụ mục đích đó. Chúng tôi ưu tiên việc sử dụng có trách nhiệm hơn là việc mở rộng quy mô khách hàng.

Nếu một trường hợp sử dụng đòi hỏi phải che giấu danh tính nhằm gây hại cho người khác, các công cụ của chúng tôi không dành cho mục đích đó. Chấm hết. Chúng tôi thà mất khách hàng còn hơn là đánh mất nguyên tắc.

Được các đội ngũ phân tích dữ liệu và các nhà phát triển AI yêu thích

Những người đang phát triển ứng dụng với Yozh nói gì

5,0 / 5 · Đánh giá 5
GitHub
Chỉ trong một buổi chiều, chúng tôi đã thay thế cụm Playwright nội bộ bằng Yozh. Điểm cuối MCP được tích hợp trực tiếp vào tác nhân Claude của chúng tôi — không cần viết mã kết nối, trình thu thập dữ liệu và trình trích xuất dữ liệu đều hoạt động ngay lập tức.
Marcus Reinhardt Kỹ sư Dữ liệu Trưởng Northwind Analytics
X
Hệ thống cài đặt sẵn chính là tính năng nổi bật nhất. Chúng tôi chỉ cần truyền vào tên nguồn là sẽ nhận lại được dữ liệu JSON đã được làm sạch; tính năng tự khắc phục lỗi thậm chí còn phát hiện ra hai thay đổi về bố cục của Amazon trước khi chúng tôi kịp nhận ra.
Priya Nair Người sáng lập ScrapeStack
Reddit
Cuối cùng thì cũng có một công cụ thu thập dữ liệu mã nguồn mở coi các máy chủ proxy và phiên làm việc là yếu tố then chốt. Chúng tôi triển khai công cụ này để truy cập các cổng thông tin đối tác có yêu cầu đăng nhập — các phiên làm việc được duy trì và kết quả luôn nhất quán trên các khu vực.
Daniel Osei Kỹ sư hệ thống phía máy chủ Loopfeed
X
Sau khi kết nối với Cursor qua MCP, hiện tại agent của tôi có thể lấy dữ liệu web thời gian thực ngay trong quá trình thực hiện tác vụ. Tính năng thu thập dữ liệu theo thời gian thực qua SSE chính là điều mà các quy trình làm việc của agent còn thiếu.
Elena Kovac Kỹ sư Trí tuệ nhân tạo Vektor Labs
GitHub
Chúng tôi đã ngừng sử dụng một API trích xuất dữ liệu trả phí để cắt giảm chi phí và chuẩn bị tinh thần cho việc chất lượng dịch vụ sẽ giảm sút — nhưng kết quả lại hoàn toàn ngược lại. Hệ thống tự vận hành, không tính phí theo từng yêu cầu, và cấu trúc dữ liệu đầu ra còn gọn gàng hơn so với dịch vụ mà trước đây chúng tôi phải trả tiền để sử dụng.
Sofia Almeida Trưởng phòng Kỹ thuật Tabbly
Nhật ký thay đổi

Nhật ký thay đổi và các bản cập nhật về trích xuất dữ liệu web

Yozh Scraper là một dự án mã nguồn mở, với tất cả các bản cập nhật đều có sẵn trên GitHub. Dưới đây là những điểm nổi bật mới nhất.

v0.1.8 10 Tháng 8 2026 Latest

v0.1.8

  • fingerprint_profile on POST /scrape/page, POST /scrape/pages and the crawler/search scrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles: auto (default, resolves to CAMOUFOX_FINGERPRINT_PROFILE, ships windows_on_host), windows_on_host, host, random, and the bare names windows / macos / linux. The old spoof_os keeps working and equals the three bare names; a caller stating both must not name conflicting operating systems. meta.applied_fingerprint reports what actually ran, including when a profile degraded. New env vars CAMOUFOX_FINGERPRINT_PROFILE (default windows_on_host) and HOST_GPU_VENDOR.
  • Extraction warns when a post_process pipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet.
  • GitHub Actions CI: pylint and pytest -m "not e2e" on every push and pull request, the checks the repo already defined but never enforced.
  • run_scrape now returns a typed envelope (ScrapeOk / ScrapeErr) built as the same pydantic models the API validates on the way out, with mypy over the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.
  • session_id, cookies and render are now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed). /search maps the rejection to a 400 rather than a 500.
v0.1.7 4 Tháng 8 2026

v0.1.7 — Pin mcp<2.0 so a fresh image build starts

  • mcp 2.0.0 made Server.__init__ keyword-only, which fastapi-mcp 0.4.x still calls positionally, so a clean docker build shipped services that raised TypeError in create_app() before serving anything. Both requirements.txt and yozh-crawler/requirements.txt now pin mcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling once fastapi-mcp ships a release built against mcp 2.x.
v0.1.6 29 Tháng 7 2026

v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification

  • Preset extraction repaired for current site layouts:
  • eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
  • Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead urls field.
  • Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
  • Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so From $19.99 / Now 19.99 parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 24 Tháng 7 2026

v0.1.5 — Queue goto-timeout retry fix + dependency security updates

  • The queue no longer retries a slow page as if the proxy were bad. A navigation (goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors, net::ERR_*) still rotate and retry as before.
  • Dependency bumps clearing the outstanding advisories in the auxiliary tooling: examples/ (langchain-anthropic) and the local scraper-tester dev harness (express, qs, http-proxy-middleware, follow-redirects). No shipped scraper runtime or API change.
v0.1.0 9 Tháng 7 2026 First release

v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2

  • New required services. Browsers no longer run inside the API process. You must now run the redis and scraper-worker services (both are already in docker-compose.yml). Scale capacity with docker compose up -d --scale scraper-worker=N.
  • POST /scrape/page and /scrape/pages can now return 503 queue_full when the Redis stream depth exceeds QUEUE_MAXSIZE (previously the in-memory queue was unbounded).
  • Removed env vars (ignored, warned at startup if set): JOB_TIMEOUT_MS → use PAGE_TASK_TIMEOUT_S; JOB_RESULT_MAX → eviction is now a native Redis TTL (JOB_RESULT_TTL_S); JOBS_ENABLED → the queue is always on.
  • New env vars: REDIS_URL, PAGE_TASK_TIMEOUT_S, LOGIN_TASK_TIMEOUT_S, LOGIN_RESULT_GRACE_S, RECLAIM_IDLE_S, JOB_RESULT_TTL_S, BROWSER_MAX_PAGES, BROWSER_IDLE_SHUTDOWN_S, WARMUP_DWELL_MS.
  • The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The web-scraper container only enqueues page tasks and reads results; browsers run in separate, horizontally scalable scraper-worker containers.
Hướng dẫn nhanh

Bắt đầu trích xuất dữ liệu từ web chỉ trong vài giây

Chỉ cần ba lệnh là bạn đã có một công cụ thu thập dữ liệu và quét web đang hoạt động với các điểm cuối HTTP và MCP.

1 Sao chép
git clone https://github.com/\
  CyberYozh-data/yozh-scraper
cd yozh-scraper
2 Chạy
cp .env.example .env
docker compose up --build
3 Cạo
curl -X POST localhost:8000/api/v1/scrape/page \
  -H 'Content-Type: application/json' \
  -d '{"url":"https://example.com"}'
Tài liệu đầy đủ Kết nối với Claude / Cursor qua MCP →
Liên hệ · Hỗ trợ

Liên hệ với chúng tôi

Một người thật sẽ đọc tất cả các tin nhắn nhận được. Hãy chọn kênh phù hợp — Telegram là kênh nhanh nhất.

Văn phòng
Jurija Gagarina 231/329
Novi Beograd · Serbia
Hỗ trợ hai cấp, gần như 24/7 Đội trực tuyến đầu tiên làm việc gần như 24/7. Các kỹ sư cấp cao sẽ xử lý các trường hợp phức tạp.
Nguồn mở · Giấy phép MIT · 84 ★

Sẵn sàng để trích xuất dữ liệu chưa?

Yozh Crawler + Scraper là ứng dụng miễn phí. Miễn phí vĩnh viễn. Hãy đánh giá sao cho chúng tôi nếu ứng dụng này hữu ích — mỗi lượt đánh giá sao đều rất quan trọng.

Yozh Crawler + Scraper được phát hành theo giấy phép MIT. Hãy sử dụng nó. Hãy tạo nhánh từ nó. Hãy phát triển dựa trên nó.