Chỉ trong một buổi chiều, chúng tôi đã thay thế cụm Playwright nội bộ bằng Yozh. Điểm cuối MCP được tích hợp trực tiếp vào tác nhân Claude của chúng tôi — không cần viết mã kết nối, trình thu thập dữ liệu và trình trích xuất dữ liệu đều hoạt động ngay lập tức.
Trích xuất
dữ liệu web dễ dàng cho các tác nhân
AI và con người
Một công cụ mã nguồn mở dùng để thu thập và trích xuất dữ liệu. Bắt đầu từ một URL duy nhất, quét trang web và thu thập dữ liệu có cấu trúc khi các trang được tải. Tương thích với MCP và các công cụ như Claude và Cursor, kèm theo các cài đặt sẵn dành cho các sàn thương mại điện tử như Amazon và eBay.
Quét toàn bộ trang web và thu thập dữ liệu chỉ trong một lần chạy
Yozh Crawler lập bản đồ toàn bộ cấu trúc trang web và xử lý các trang ngay khi phát hiện chúng. Bạn sẽ nhận được cả phạm vi quét và kết quả có thể sử dụng chỉ trong một lần chạy, mà không cần phải quản lý các bước thu thập dữ liệu và trích xuất riêng biệt. Công cụ này hoạt động trực tiếp trong các quy trình thu thập dữ liệu và trích xuất hiện có của bạn.
Yozh Crawler, tích hợp NEW
Bắt đầu từ một URL và lập bản đồ toàn bộ trang web. Các trang được phát hiện và xử lý trong một lần chạy duy nhất, nhờ đó bạn có được phạm vi bao quát toàn diện mà không cần thực hiện thêm bất kỳ bước nào.
Chế độ Khám phá NEW
Chỉ cần các liên kết? Hãy chuyển sang chế độ khám phá và lập bản đồ trang web mà không cần phân tích cú pháp. Nhanh hơn, nhẹ hơn và hữu ích cho việc kiểm toán và kiểm tra cấu trúc.
Trình duyệt ẩn danh
So khớp các tiêu đề, vị trí và tín hiệu trình duyệt với máy chủ proxy của bạn. Giúp duy trì tính nhất quán của các phiên trên các khu vực khác nhau.
Trích xuất dữ liệu theo lô
Chạy hàng trăm URL trong một yêu cầu. Xử lý tất cả song song và trả về một kết quả duy nhất.
Hủy hai giai đoạn NEW
Tạm dừng các tác vụ mà không làm gián đoạn kết quả. Cho phép các trang đang hoạt động hoàn tất hoặc dừng mọi thứ ngay lập tức khi cần thiết.
Tích hợp MCP
Kết nối trực tiếp với các công cụ như Claude và Cursor. Tích hợp các kỹ thuật trích xuất dữ liệu và thu thập dữ liệu vào quy trình làm việc hiện tại của bạn.
10 cài đặt sẵn tích hợp sẵn
Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — chỉ cần truyền tên nguồn và các tham số, bạn sẽ nhận được phản hồi đã được chuẩn hóa. Không cần phải viết các selector.
Khả năng tự phục hồi của LLM NEW
Một trang web triển khai thay đổi bố cục và các bộ chọn CSS của bạn trả về kết quả trống? Trình phân tích cú pháp sẽ yêu cầu một mô hình ngôn ngữ lớn (LLM) (OpenAI / Anthropic / Gemini / OpenRouter) tái tạo bộ chọn ngay lập tức. Quy trình xử lý vẫn tiếp tục chạy.
Các cài đặt sẵn do AI tạo ra NEW
Bạn cần một trang web mà chúng tôi chưa cung cấp cài đặt sẵn? Hãy mô tả nội dung cần trích xuất và dán một URL mẫu vào — POST /api/v1/presets/generate sẽ trả về một preset JSON đã sẵn sàng.
Các phiên đã được xác thực NEW
Đăng nhập một lần thông qua ngôn ngữ kịch bản khai báo (goto / fill / click / wait) hoặc dán các tệp cookie đã xuất. Tái sử dụng phiên đăng nhập này trong mỗi lần thu thập dữ liệu. Yêu cầu bắt buộc đối với các mục tiêu có tường lửa như cài đặt sẵn LinkedIn.
Hệ thống thu thập dữ liệu đơn giản do chính bạn kiểm soát
Thiết lập quy trình làm việc của bạn tại một nơi duy nhất và vận hành theo cách bạn cần. Mọi thứ đều rõ ràng, có hệ thống và dễ quản lý mà không cần đến các công cụ bổ sung.
Các máy chủ proxy tích hợp sẵn, sẵn sàng sử dụng
Truy cập các proxy dân dụng, di động và trung tâm dữ liệu tại hơn 120 quốc gia. Hơn 50 triệu địa chỉ IP với thời gian hoạt động 99,9%. Bao gồm tính năng nhận dạng dấu vân tay để đồng bộ hóa hành vi của thiết bị, trình duyệt và mạng, nhằm đảm bảo các phiên kết nối ổn định và khả năng kiểm soát tốt hơn.
Trích xuất dữ liệu linh hoạt
Sử dụng các bộ chọn CSS, XPath hoặc tính năng tự động phát hiện cho các trang web phổ biến. Nhận dữ liệu JSON gọn gàng, có cấu trúc mà không cần thiết lập phức tạp.
Tất cả dữ liệu được tập trung tại một nơi
Tải về mã HTML thô, ảnh chụp màn hình và dữ liệu đã được phân tích cùng một lúc. Tất cả những gì bạn cần, mà không cần phải chuyển đổi giữa các công cụ.
Điều khiển đơn giản và quyền truy cập MCP
Dừng các tác vụ bất cứ lúc nào chỉ với một cú nhấp chuột và chuyển đổi giữa chế độ scraper và crawler. Quy trình làm việc của bạn vẫn đơn giản và hoàn toàn nằm trong tầm kiểm soát của bạn.
Các tác nhân AI được phát triển để thu thập và quét dữ liệu trên web
Kết nối Yozh Crawler và Yozh Scraper với Claude, Cursor hoặc bất kỳ ứng dụng khách MCP nào. Chuyển đổi công cụ chỉ bằng một nút gạt, không cần thêm mã.
Các tính năng thu thập dữ liệu từ web
Tất cả các tính năng của Yozh Scraper đều có sẵn dưới dạng các hàm cho agent của bạn, bao gồm trích xuất dữ liệu, chạy theo lô và chụp ảnh màn hình.
Chỉ mất một phút để kết nối
Sao chép tệp cấu hình, khởi động lại ứng dụng khách của bạn, và thế là xong.
Hoạt động với bất kỳ máy khách MCP nào
Claude Desktop, Cursor, Cline hoặc các tác nhân tùy chỉnh.
Kiểm soát hoàn toàn bộ công cụ
Chọn cách thức mà tác nhân của bạn thực thi các tác vụ, từ từng trang riêng lẻ đến toàn bộ lô tác vụ.
Hãy thực hiện theo cách của bạn
Sử dụng máy chủ MCP tại địa phương hoặc triển khai nó trên hạ tầng của riêng bạn.
// ~/Library/Application Support/Claude/claude_desktop_config.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cursor → Settings → MCP → Add new MCP Server { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cline → MCP Servers → Edit cline_mcp_settings.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp", "disabled": false }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp", "disabled": false } } }
// Anthropic Messages API · MCP via Streamable HTTP // Note: scraper must be reachable from Anthropic's servers (deploy publicly) import Anthropic from "@anthropic-ai/sdk"; const response = await new Anthropic().messages.create({ model: "claude-opus-4-8", mcp_servers: [ { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" }, { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" } ], messages: [...] });
Truy cập, truyền phát và phân tích các trang web theo thời gian thực
Yozh Crawler bắt đầu từ một URL, phát hiện các trang trên toàn bộ trang web và xử lý chúng ngay khi chúng được tải, mang đến cho bạn cấu trúc đầy đủ và dữ liệu có thể sử dụng chỉ trong một lần chạy.
Phát trực tiếp
Các trang sẽ hiển thị ngay khi được phát hiện và xử lý. Bạn có thể truy cập trực tiếp từ khách hàng, đại lý hoặc quy trình làm việc của mình mà không cần đợi quá trình xử lý hoàn tất.
Chế độ Khám phá
Chỉ cần các liên kết? Tạo sơ đồ trang web mà không cần phân tích cú pháp. Nhanh hơn và tiết kiệm chi phí hơn khi kiểm tra cấu trúc và thực hiện kiểm toán.
Hủy hai giai đoạn
Dừng các tác vụ một cách an toàn. Hãy để các trang đang hoạt động hoàn tất hoặc dừng mọi thứ ngay lập tức khi cần thiết.
Công tắc mục tiêu MCP
Chuyển đổi giữa chế độ scraper và crawler chỉ bằng một nút gạt. Trình tự động của bạn sẽ sử dụng công cụ phù hợp cho từng tác vụ.
Cây trang web trực tiếp trên giao diện người dùng
Theo dõi quá trình xây dựng cấu trúc trang web theo thời gian thực. Theo dõi tiến độ từng trang một mà không cần rời khỏi bảng điều khiển.
Result
▶ Site Map (0 pages)
| URL | Parent | Depth | Status | Took |
|---|
Từ một URL đến phạm vi bao quát toàn bộ trang web
Trình thu thập dữ liệu tìm kiếm các trang web, trình trích xuất dữ liệu xử lý chúng, và trợ lý AI của bạn sẽ sử dụng kết quả thu được — được thiết kế dành cho cả người mới bắt đầu lẫn chuyên gia.
Xe bò
Tìm tất cả các URL
Yozh Scraper
Trích xuất sang JSON
Trợ lý AI
Phân tích và ra quyết định
Phân tích cạnh tranh
Theo dõi danh mục sản phẩm, giá cả và thông tin chi tiết về sản phẩm của các đối thủ cạnh tranh tại một nơi duy nhất. Phát hiện những điểm còn thiếu sót trong danh mục sản phẩm của chính bạn và phản ứng nhanh hơn trước những thay đổi của thị trường.
Theo dõi giá cả
Tự động theo dõi biến động giá trên các sàn thương mại điện tử. Thiết lập cảnh báo và nhận thông báo qua Telegram hoặc Slack khi giá có biến động.
Dữ liệu huấn luyện ML
Thu thập các bộ dữ liệu sạch, có cấu trúc từ các nguồn công khai, sẵn sàng để phân tích hoặc huấn luyện mô hình. Được thiết kế để thu thập dữ liệu đáng tin cậy trên quy mô lớn.
Bắt đầu trích xuất dữ liệu ngay lập tức với các cài đặt sẵn có thể sử dụng ngay
Cài đặt vùng, đơn vị tiền tệ, bộ lọc và cơ chế chống bot — đã được cấu hình sẵn. Hãy chọn một cài đặt sẵn để xem những thông tin nào sẽ được trích xuất.
Every Amazon listing, normalized
All fields below are extracted automatically — no selectors to write.
Bạn cần một trang web mà chúng tôi chưa đề cập đến?
Hãy tạo một vấn đề trên GitHub hoặc đóng góp cài đặt sẵn của riêng bạn — chúng tôi sẽ xem xét các yêu cầu kéo (PR) trong vòng một tuần.
Các máy chủ proxy được thiết kế để thu thập dữ liệu
Ba loại, sáu cấu hình. Hãy lựa chọn dựa trên công việc, tốc độ và ngân sách.
Di động 4G/5G
Các thiết bị di động thực tế trên mạng của các nhà mạng. Mức độ tin cậy cao nhất với hệ thống chống bot nghiêm ngặt.
Thiết bị cá nhân, xoay vòng địa chỉ IP thủ công qua API
Một thiết bị, nhiều người dùng
Tìm hiểu thêm về proxy di động
Cách thức hoạt động
Mỗi địa chỉ IP đều xuất phát từ một chiếc điện thoại thông minh thực tế hoặc một modem LTE/5G được kết nối với một nhà mạng di động lớn. Địa chỉ IP này được chia sẻ bởi hàng nghìn thuê bao thường xuyên, do đó việc chặn địa chỉ IP này đồng nghĩa với việc chặn cả những người dùng thực — đó chính là lý do tại sao các hệ thống chống bot tin tưởng vào địa chỉ IP di động nhất.
Phù hợp nhất cho
- Quản lý tài khoản trên các nền tảng mạng xã hội
- Các biện pháp chống bot mạnh mẽ (Cloudflare, PerimeterX)
- Hoạt động liên kết và xác minh quảng cáo
- Các nhiệm vụ đòi hỏi sự tin cậy “giống con người” một cách bền vững
Thông số kỹ thuật
- Mạng 4G LTE và 5G trên toàn thế giới
- Hỗ trợ UDP, kết nối VPN VLS
- Chuyển đổi địa chỉ IP thủ công qua API hoặc liên kết trên bảng điều khiển
- Điều chỉnh dấu vân tay hệ điều hành
- Băng thông không giới hạn trên hầu hết các gói cước
Dân cư
Các địa chỉ IP từ người dùng internet gia đình thực sự tại hơn 120 quốc gia. Quyền truy cập vào hơn 50 triệu địa chỉ IP với sự cân bằng tối ưu giữa độ tin cậy và chi phí.
Bộ định tuyến chính hãng, địa chỉ IP cố định trong suốt thời gian thuê
Hơn 100 triệu địa chỉ IP, tự động luân phiên theo hẹn giờ hoặc theo yêu cầu
Tìm hiểu thêm về proxy dành cho hộ gia đình
Cách thức hoạt động
Các địa chỉ IP dân dụng được lấy từ những người dùng Internet tại nhà thực sự, những người đã đồng ý chia sẻ băng thông để đổi lấy khoản bồi thường, thông qua một mạng lưới tham gia tự nguyện và minh bạch. Kết nối của họ trông giống như bất kỳ người dùng gia đình nào khác — bởi vì đó chính là một người dùng gia đình.
Phù hợp nhất cho
- Trích xuất dữ liệu web trên quy mô lớn (điểm tối ưu)
- Thu thập dữ liệu từ các sàn thương mại điện tử
- Nghiên cứu SEO, trích xuất dữ liệu từ trang kết quả tìm kiếm (SERP)
- Theo dõi thương hiệu và giá cả
- Các chiến dịch xác minh quảng cáo
Thông số kỹ thuật
- Hơn 120 quốc gia, hơn 100 triệu địa chỉ IP duy nhất trong nhóm luân phiên
- Chọn chế độ tĩnh hoặc luân phiên tùy theo nhiệm vụ
- Hỗ trợ nhắm mục tiêu theo thành phố và ASN
- Hỗ trợ các giao thức HTTPS, SOCKS5
- Phiên kết nối ổn định lên đến 30 phút
Trung tâm dữ liệu
Tốc độ tối đa, chi phí tối thiểu. Hơn 2 triệu địa chỉ IP tại các trung tâm dữ liệu trên toàn thế giới.
Một địa chỉ IP được cấp cho bạn, lưu lượng truy cập không giới hạn
Bể chung – giải pháp tiết kiệm chi phí cho các công việc đơn giản
Tìm hiểu thêm về các máy chủ proxy trung tâm dữ liệu
Cách thức hoạt động
Các địa chỉ IP này được lưu trữ tại các trung tâm dữ liệu, không kết nối trực tiếp với người dùng tại nhà hay người dùng di động. Chúng rẻ hơn và nhanh hơn so với các địa chỉ IP dành cho hộ gia đình, nhưng các hệ thống chống bot có thể nhận diện chúng là không phải do con người điều khiển, vì vậy hãy sử dụng chúng trong những trường hợp mà yếu tố tin cậy không phải là vấn đề then chốt.
Phù hợp nhất cho
- Trích xuất dữ liệu với khối lượng lớn từ các trang web thân thiện
- Công cụ nội bộ và thử nghiệm tải
- Các điểm cuối API không có bộ lọc tin cậy IP
- Các tác vụ mà tốc độ quan trọng hơn việc ngụy trang
Thông số kỹ thuật
- Hơn 2 triệu địa chỉ IPv4 và IPv6
- Cấu hình chuyên dụng hoặc chia sẻ
- Băng thông không giới hạn trên các gói chuyên dụng
- Hỗ trợ các giao thức HTTPS, SOCKS5
- Độ trễ thấp nhất trong cả ba loại
Đạo đức là một phần không thể tách rời trong cách chúng tôi vận hành nền tảng của mình
Mã nguồn mở chỉ là điểm khởi đầu. Cách thu thập dữ liệu và cách tìm nguồn cung cấp máy chủ proxy cũng quan trọng không kém. Đây là những tiêu chuẩn mà chúng tôi tuân thủ trong thực tế, chứ không chỉ là những tuyên bố trên trang web.
Thu thập dữ liệu tuân thủ đạo đức
Chúng tôi phát triển các công cụ, chứ không phải các lỗ hổng. Yozh Scraper được thiết kế để đảm bảo việc trích xuất dữ liệu công khai một cách hợp pháp diễn ra đáng tin cậy — chứ không phải để xâm phạm những thông tin cần được bảo mật.
- Chỉ dữ liệu công khai — theo mặc định, không cho phép thu thập dữ liệu khi đã đăng nhập
- Các giới hạn tốc độ tích hợp sẵn giúp ngăn chặn tình trạng quá tải máy chủ
- Mặc định tuân thủ robots.txt và sơ đồ trang web (có thể thay đổi)
- Không thu thập hay lưu trữ thông tin nhận dạng cá nhân (PII) — cả từ phía chúng tôi lẫn theo mặc định đối với người dùng
- Các công cụ giúp bạn tuân thủ các quy định của GDPR và CCPA
Mạng proxy trong suốt
Nguồn gốc của các địa chỉ IP dân dụng chính là thước đo độ trung thực đối với mọi nhà cung cấp dịch vụ proxy. Dưới đây là nguồn gốc cụ thể của các địa chỉ IP của chúng tôi — được nêu rõ ràng như sau:
- Mạng lưới tham gia tự nguyện. Người dùng thực sự đồng ý và kiếm tiền khi chia sẻ băng thông
- Hủy đăng ký chỉ với một cú nhấp chuột bất cứ lúc nào, không cần giải thích lý do
- Chuỗi cung ứng đã được kiểm toán với quy trình tìm nguồn cung ứng được ghi chép đầy đủ
- Hoàn toàn không có phần mềm độc hại, hoàn toàn không có việc chèn SDK ẩn — chưa từng xảy ra
- Các địa chỉ IP di động từ các thiết bị do chúng tôi sở hữu và vận hành, chứ không phải từ các điện thoại di động đã bị xâm nhập
Phản ứng nhanh chóng trước các hành vi lạm dụng
Nếu có ai đó lạm dụng cơ sở hạ tầng của chúng tôi để gây hại cho người khác, chúng tôi muốn biết — và sẽ có biện pháp xử lý trước khi tình hình trở nên tồi tệ hơn.
- Đường dây trực tiếp đến nhân viên thực sự, không phải hệ thống xếp hàng qua phiếu yêu cầu
- Quy trình điều tra minh bạch đối với mọi báo cáo hợp lệ
- Hợp tác tích cực với các cơ quan thực thi pháp luật trong các trường hợp đã được xác nhận
- Chính sách về lạm dụng công khai, không bị giấu trong những dòng chữ nhỏ li ti
Nếu một trường hợp sử dụng liên quan đến việc lạm dụng hoặc gây hại, các công cụ của chúng tôi không được thiết kế để phục vụ mục đích đó. Chúng tôi ưu tiên việc sử dụng có trách nhiệm hơn là việc mở rộng quy mô khách hàng.
Nếu một trường hợp sử dụng đòi hỏi phải che giấu danh tính nhằm gây hại cho người khác, các công cụ của chúng tôi không dành cho mục đích đó. Chấm hết. Chúng tôi thà mất khách hàng còn hơn là đánh mất nguyên tắc.
Các chính sách và tiêu chuẩn của chúng tôi
Các quy tắc rõ ràng hướng dẫn cách thức hoạt động của chúng tôi, từ việc thu thập dữ liệu đến việc tìm nguồn cung ứng đại lý và sử dụng nền tảng. Đây là những chính sách thực tế mà đội ngũ của chúng tôi tuân thủ, chứ không phải là những bản tóm tắt.
Chính sách Sử dụng
Xác định những gì được phép và những gì bị hạn chế trên hạ tầng của chúng tôi, kèm lý giải rõ ràng.
Chính sách xử lý hành vi lạm dụng
Giải thích cách các báo cáo được xem xét, xử lý và giải quyết, bao gồm cả thời gian phản hồi.
Tiêu chuẩn tìm nguồn mạng lưới
Nêu chi tiết cách thu thập IP dân cư và di động, với mô hình đồng ý tham gia (opt-in) và nguồn cung đã được xác minh.
Chính sách xác minh khách hàng
Bao gồm quy trình tiếp nhận, khi nào cần xác minh và cách xử lý dữ liệu người dùng.
Mục tiêu bị hạn chế
Liệt kê các tên miền và trường hợp sử dụng bị chặn, bao gồm các lĩnh vực nhạy cảm như chính phủ và tài chính.
Chính sách xử lý dữ liệu
Giải thích dữ liệu nào được thu thập, dữ liệu nào không được lưu trữ, giới hạn thời gian lưu giữ và việc chia sẻ với bên thứ ba.
Các đội sử dụng
dữ liệu CyberYozh như thế nào
Các dự án triển khai trong thực tế
Trích xuất dữ liệu từ web và phân tích
Tự động hóa việc thu thập dữ liệu công khai trên quy mô lớn: danh mục sản phẩm, xếp hạng, đánh giá, dữ liệu địa lý. Yozh Scraper kết hợp với các proxy dân cư — hợp pháp, ổn định và sạch.
Đọc thêm
Các tác nhân AI và tự động hóa
Xây dựng các tác nhân tự động có khả năng thu thập dữ liệu, phân tích và thực hiện hành động. Tính năng tích hợp MCP biến Yozh Scraper thành một công cụ tích hợp sẵn cho Claude và Cursor — không cần phải thực hiện tích hợp tùy chỉnh.
Đọc thêm
Thương mại điện tử và các sàn giao dịch
Theo dõi giá cả, hàng tồn kho và tình trạng sẵn có của sản phẩm trên Amazon, eBay và các sàn thương mại điện tử khác trên toàn thế giới. Các cài đặt sẵn giúp tiết kiệm hàng tuần công sức phát triển.
Đọc thêmPhản hồi từ giới truyền thông và các doanh nghiệp
Những đánh giá trung thực từ các nguồn độc lập
Tất cả các bài viết
AFFMaven Reviews CyberYozh's Proxy & Multi-Accounting Platform
"CyberYozh stands out as a powerful platform for affiliates and arbitrage teams, combining reliable proxy infrastructure, identity tools, and strong support in one ecosystem."
TechBullion Covers CyberYozh's B2B Platform Expansion
"CyberYozh App enables businesses to launch, test, and operate digital products across more than 30 countries through a scalable infrastructure built for global connectivity, verification, and digital operations."
Grit Daily Highlights CyberYozh's Infrastructure for Enterprise Proxy Workloads
"Built for organizations that rely on proxies every day, CyberYozh App delivers infrastructure designed for stability, scalability, and high-volume workloads rather than one-off sessions."
Được các đội ngũ phân tích dữ liệu và các nhà phát triển AI yêu thích
Những người đang phát triển ứng dụng với Yozh nói gì
Hệ thống cài đặt sẵn chính là tính năng nổi bật nhất. Chúng tôi chỉ cần truyền vào tên nguồn là sẽ nhận lại được dữ liệu JSON đã được làm sạch; tính năng tự khắc phục lỗi thậm chí còn phát hiện ra hai thay đổi về bố cục của Amazon trước khi chúng tôi kịp nhận ra.
Cuối cùng thì cũng có một công cụ thu thập dữ liệu mã nguồn mở coi các máy chủ proxy và phiên làm việc là yếu tố then chốt. Chúng tôi triển khai công cụ này để truy cập các cổng thông tin đối tác có yêu cầu đăng nhập — các phiên làm việc được duy trì và kết quả luôn nhất quán trên các khu vực.
Sau khi kết nối với Cursor qua MCP, hiện tại agent của tôi có thể lấy dữ liệu web thời gian thực ngay trong quá trình thực hiện tác vụ. Tính năng thu thập dữ liệu theo thời gian thực qua SSE chính là điều mà các quy trình làm việc của agent còn thiếu.
Chúng tôi đã ngừng sử dụng một API trích xuất dữ liệu trả phí để cắt giảm chi phí và chuẩn bị tinh thần cho việc chất lượng dịch vụ sẽ giảm sút — nhưng kết quả lại hoàn toàn ngược lại. Hệ thống tự vận hành, không tính phí theo từng yêu cầu, và cấu trúc dữ liệu đầu ra còn gọn gàng hơn so với dịch vụ mà trước đây chúng tôi phải trả tiền để sử dụng.
Giới thiệu về web scraping, crawling và các tác nhân AI
Blog và bài viết
Tất cả các bài viết
Proxy di động riêng năm 2026: Vì sao cần đường hầm UDP và VLESS để vượt qua DPI
Các hệ thống kiểm tra sâu gói tin (DPI) chủ động quét và chặn các kết nối VPN tiêu chuẩn. OpenVPN và WireGuard thất bại chỉ…
Giải pháp thay thế Instant Data Scraper tốt nhất năm 2026
So sánh Instant Data Scraper với CyberYozh và tìm hiểu khi nào các trình crawler có thể mở rộng, xoay proxy, nhắm mục tiêu theo địa…
Proxy di động tốt nhất cho tự động hóa mạng xã hội (Reddit, Instagram, TikTok)
Việc chạy tự động hóa trên Reddit, Instagram hoặc TikTok thường hoạt động tốt lúc đầu, sau đó bắt đầu gặp trục trặc mà không rõ…
Nhật ký thay đổi và các bản cập nhật về trích xuất dữ liệu web
Yozh Scraper là một dự án mã nguồn mở, với tất cả các bản cập nhật đều có sẵn trên GitHub. Dưới đây là những điểm nổi bật mới nhất.
v0.1.8
fingerprint_profileonPOST /scrape/page,POST /scrape/pagesand the crawler/searchscrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles:auto(default, resolves toCAMOUFOX_FINGERPRINT_PROFILE, shipswindows_on_host),windows_on_host,host,random, and the bare nameswindows/macos/linux. The oldspoof_oskeeps working and equals the three bare names; a caller stating both must not name conflicting operating systems.meta.applied_fingerprintreports what actually ran, including when a profile degraded. New env varsCAMOUFOX_FINGERPRINT_PROFILE(defaultwindows_on_host) andHOST_GPU_VENDOR.- Extraction warns when a
post_processpipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet. - GitHub Actions CI:
pylintandpytest -m "not e2e"on every push and pull request, the checks the repo already defined but never enforced. run_scrapenow returns a typed envelope (ScrapeOk/ScrapeErr) built as the same pydantic models the API validates on the way out, withmypyover the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.session_id,cookiesandrenderare now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed)./searchmaps the rejection to a 400 rather than a 500.
v0.1.7 — Pin mcp<2.0 so a fresh image build starts
mcp2.0.0 madeServer.__init__keyword-only, whichfastapi-mcp0.4.x still calls positionally, so a cleandocker buildshipped services that raisedTypeErrorincreate_app()before serving anything. Bothrequirements.txtandyozh-crawler/requirements.txtnow pinmcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling oncefastapi-mcpships a release built againstmcp2.x.
v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification
- Preset extraction repaired for current site layouts:
- eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
- Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead
urlsfield. - Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
- Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so
From $19.99/Now 19.99parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 — Queue goto-timeout retry fix + dependency security updates
- The queue no longer retries a slow page as if the proxy were bad. A navigation (
goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors,net::ERR_*) still rotate and retry as before. - Dependency bumps clearing the outstanding advisories in the auxiliary tooling:
examples/(langchain-anthropic) and the localscraper-testerdev harness (express,qs,http-proxy-middleware,follow-redirects). No shipped scraper runtime or API change.
v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2
- New required services. Browsers no longer run inside the API process. You must now run the
redisandscraper-workerservices (both are already indocker-compose.yml). Scale capacity withdocker compose up -d --scale scraper-worker=N. POST /scrape/pageand/scrape/pagescan now return503 queue_fullwhen the Redis stream depth exceedsQUEUE_MAXSIZE(previously the in-memory queue was unbounded).- Removed env vars (ignored, warned at startup if set):
JOB_TIMEOUT_MS→ usePAGE_TASK_TIMEOUT_S;JOB_RESULT_MAX→ eviction is now a native Redis TTL (JOB_RESULT_TTL_S);JOBS_ENABLED→ the queue is always on. - New env vars:
REDIS_URL,PAGE_TASK_TIMEOUT_S,LOGIN_TASK_TIMEOUT_S,LOGIN_RESULT_GRACE_S,RECLAIM_IDLE_S,JOB_RESULT_TTL_S,BROWSER_MAX_PAGES,BROWSER_IDLE_SHUTDOWN_S,WARMUP_DWELL_MS. - The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The
web-scrapercontainer only enqueues page tasks and reads results; browsers run in separate, horizontally scalablescraper-workercontainers.
Bắt đầu trích xuất dữ liệu từ web chỉ trong vài giây
Chỉ cần ba lệnh là bạn đã có một công cụ thu thập dữ liệu và quét web đang hoạt động với các điểm cuối HTTP và MCP.
git clone https://github.com/\ CyberYozh-data/yozh-scraper cd yozh-scraper
cp .env.example .env docker compose up --build
curl -X POST localhost:8000/api/v1/scrape/page \
-H 'Content-Type: application/json' \
-d '{"url":"https://example.com"}'
Liên hệ với chúng tôi
Một người thật sẽ đọc tất cả các tin nhắn nhận được. Hãy chọn kênh phù hợp — Telegram là kênh nhanh nhất.
Sẵn sàng để trích xuất dữ liệu chưa?
Yozh Crawler + Scraper là ứng dụng miễn phí. Miễn phí vĩnh viễn. Hãy đánh giá sao cho chúng tôi nếu ứng dụng này hữu ích — mỗi lượt đánh giá sao đều rất quan trọng.
Yozh Crawler + Scraper được phát hành theo giấy phép MIT. Hãy sử dụng nó. Hãy tạo nhánh từ nó. Hãy phát triển dựa trên nó.