Platform jual beli apa saja yang Anda dukung?
10 preset bawaan yang src/presets/builtin/ yang mencakup sumber data terbesar: amazon_product (AS, Inggris, Jerman, Prancis, Jepang), amazon_search (AS, Inggris, Jerman), ebay_search (AS, Inggris, Jerman), walmart_product (AS), google_search (AS, Inggris, Jerman, Prancis, Rusia, Jepang), google_shopping (AS, Inggris, Jerman), bing_search (AS, Inggris, Jerman, Prancis, Rusia, Jepang), yandex_search (AS, Inggris, Jerman, Prancis, Rusia, Jepang), youtube_video (global), linkedin_profile (global, memerlukan session_id). Butuh yang lain? Gunakan POST /api/v1/presets/generate dengan URL contoh — LLM akan menyimpulkan skema dan menghasilkan pemilih untuk Anda.
Seberapa stabilkah skema tersebut?
Bentuk kolom yang sama di seluruh wilayah dan preset — amazon_product di .us, .uk, .de, .fr, .jp semuanya mengembalikan kunci yang identik (mata uang disesuaikan dengan wilayah, struktur tetap sama). Bidang opsional secara eksplisit dapat bernilai null, sehingga nilai yang hilang tidak akan pernah mengganggu parser Anda. Ketika tata letak marketplace berubah, LLM secara otomatis memperbarui selektor secara real-time (cantumkan llm: {model: "..."} dalam permintaan) — pipa tetap berjalan dengan self_heal: true flag dalam respons. Perubahan yang memengaruhi kompatibilitas mundur hanya dirilis dalam versi minor dengan catatan migrasi di CHANGELOG.md.
Apakah saya bisa melakukan scraping pada Amazon / eBay / Walmart?
Ya — ketiganya adalah preset kelas satu, tanpa konfigurasi tambahan. Amazon mencakup 5 wilayah regional (us, uk, de, fr, jp) untuk halaman detail produk (PDP) dan pencarian; eBay mencakup pencarian di us/uk/de; Walmart .us untuk halaman produk. Masing-masing mengembalikan struktur JSON yang sama: title, price, currency, in_stock, rating, seller, ditambah bidang-bidang khusus pasar jika ada (ASIN, pemenang Buy Box, tanda sponsor). Untuk data yang terikat akun di balik login (harga Prime, portal mitra), gunakan API Sessions dan sertakan session_id bersama permintaan.
Seberapa cepat saya bisa mendapatkan data pertama?
Sekitar 5 menit dari awal hingga akhir. git clone + docker compose up -d Menjalankan scraper dalam waktu sekitar 30 detik (Docker mengunduh gambar sekali). Pertama-tama curl POST /api/v1/scrape/preset/page mengembalikan JSON terstruktur dalam 1–3 detik untuk locale yang tersimpan dalam cache, hingga 5–8 detik untuk yang belum pernah diakses. Tanpa pendaftaran, tanpa pembuatan kunci API, tanpa pengukuran SaaS — Anda cukup mengakses titik akhir localhost:8000 saat kontainer dalam kondisi baik.
Apakah Anda menangani proxy dan sistem anti-bot?
Ya. Scraper ini terintegrasi dengan CyberYozh App Proxy melalui CYBERYOZH_API_KEY — 5 jenis proxy yang mencakup 250 kode negara (proxy residensial bergilir/tetap, seluler 4G/5G, pusat data, ISP). Perlindungan anti-bot ditangani oleh build Chromium tersembunyi dengan sidik jari hangat, proxy residensial yang sesuai, dan waktu respons layaknya manusia — sebagian besar alur proses menghindari CAPTCHA sepenuhnya. Jika CAPTCHA muncul, scraper akan mengembalikannya sebagai kesalahan terstruktur alih-alih menyelesaikannya secara diam-diam. Aturan praktis: gunakan proxy residensial bergilir untuk pengikisan skala katalog, dan proxy seluler untuk zona anti-bot yang ketat atau tugas yang terikat akun.