Các sàn thương mại điện tử nào được hỗ trợ?
10 cài đặt sẵn tích hợp src/presets/builtin/ bao gồm các nguồn dữ liệu lớn nhất: amazon_product (Mỹ, Anh, Đức, Pháp, Nhật), amazon_search (Mỹ, Anh, Đức), ebay_search (Mỹ, Anh, Đức), walmart_product (Mỹ), google_search (Mỹ, Anh, Đức, Pháp, Nga, Nhật), google_shopping (Mỹ, Anh, Đức), bing_search (Mỹ, Anh, Đức, Pháp, Nga, Nhật), yandex_search (Mỹ, Anh, Đức, Pháp, Nga, Nhật), youtube_video (toàn cầu), linkedin_profile (toàn cầu, yêu cầu session_id). Cần thứ gì khác? Hãy sử dụng POST /api/v1/presets/generate với một URL mẫu — một mô hình ngôn ngữ lớn (LLM) sẽ tự động suy luận cấu trúc dữ liệu và tạo các bộ chọn cho bạn.
Cấu trúc dữ liệu này ổn định đến mức nào?
Cấu trúc trường dữ liệu giống nhau trên các khu vực và cài đặt sẵn — amazon_product trong các miền .us, .uk, .de, .fr, .jp đều trả về các khóa giống hệt nhau (đơn vị tiền tệ được địa phương hóa, cấu trúc không thay đổi). Các trường tùy chọn được cho phép có giá trị null một cách rõ ràng, do đó các giá trị bị thiếu sẽ không bao giờ làm hỏng trình phân tích cú pháp của bạn. Khi một nền tảng thương mại điện tử thay đổi bố cục, tính năng tự phục hồi của LLM sẽ tự động tái tạo bộ chọn ngay lập tức (chỉ cần llm: {model: "..."} trong yêu cầu) — quy trình xử lý tiếp tục hoạt động với self_heal: true cờ trong phản hồi. Các thay đổi gây gián đoạn chỉ được phát hành trong các phiên bản phụ kèm theo ghi chú chuyển đổi trong CHANGELOG.md.
Tôi có thể trích xuất dữ liệu từ Amazon / eBay / Walmart không?
Đúng vậy — cả ba đều là các cài đặt sẵn chất lượng cao, không cần cấu hình thêm. Amazon hỗ trợ 5 khu vực địa phương (us, uk, de, fr, jp) cho trang chi tiết sản phẩm (PDP) và tìm kiếm; eBay hỗ trợ tìm kiếm tại us/uk/de; Walmart .us dành cho trang sản phẩm. Mỗi dịch vụ đều trả về cấu trúc JSON giống nhau: title, price, currency, in_stock, rating, seller, cùng với các trường dữ liệu đặc thù của từng nền tảng (nếu có) như ASIN, người chiến thắng Buy Box, cờ quảng cáo. Đối với dữ liệu liên quan đến tài khoản yêu cầu đăng nhập (giá Prime, cổng thông tin đối tác), hãy sử dụng API Sessions và truyền session_id cùng với yêu cầu.
Tôi có thể nhận được dữ liệu đầu tiên trong bao lâu?
Tổng thời gian khoảng 5 phút. git clone + docker compose up -d Kích hoạt công cụ trích xuất dữ liệu trong khoảng 30 giây (Docker tải hình ảnh một lần). Lần đầu tiên curl POST /api/v1/scrape/preset/page trả về dữ liệu JSON có cấu trúc trong 1–3 giây đối với các vùng ngôn ngữ đã được lưu trong bộ nhớ đệm, và tối đa 5–8 giây khi chưa có dữ liệu trong bộ nhớ đệm. Không cần đăng ký, không cần tạo khóa API, không có hệ thống tính phí SaaS — bạn chỉ cần truy cập điểm cuối localhost:8000 ngay khi container hoạt động bình thường.
Quý vị có hỗ trợ proxy và chống bot không?
Đúng vậy. Công cụ trích xuất dữ liệu này tích hợp với CyberYozh App Proxy thông qua CYBERYOZH_API_KEY — 5 loại proxy trải rộng trên 250 mã quốc gia (proxy dân cư xoay vòng / cố định, di động 4G/5G, trung tâm dữ liệu, ISP). Chức năng chống bot được xử lý bởi phiên bản Chromium ẩn danh với dấu vân tay ấm, kết hợp với proxy dân cư và thời gian truy cập giống con người — hầu hết các luồng truy cập đều tránh được CAPTCHA hoàn toàn. Khi CAPTCHA xuất hiện, công cụ thu thập dữ liệu sẽ trả về dưới dạng lỗi có cấu trúc thay vì tự động giải quyết mà không thông báo. Nguyên tắc chung: sử dụng proxy dân cư luân phiên cho việc thu thập dữ liệu quy mô danh mục, và proxy di động cho các khu vực có biện pháp chống bot nghiêm ngặt hoặc các tác vụ liên quan đến tài khoản.