Dalam satu sore, kami mengganti klaster Playwright internal kami dengan Yozh. Titik akhir MCP langsung terintegrasi ke dalam agen Claude kami — tanpa perlu kode penghubung sama sekali, crawler dan scraper langsung berfungsi dengan baik.
Pengambilan
data web yang mudah untuk agen
AI dan manusia
Salah satu alat sumber terbuka untuk pengumpulan dan penggalian data. Mulailah dari satu URL, jelajahi situs tersebut, dan peroleh data terstruktur seiring dimuatnya halaman-halaman. Dapat digunakan bersama MCP dan alat-alat seperti Claude dan Cursor, serta dilengkapi dengan pengaturan siap pakai untuk platform pasar seperti Amazon dan eBay.
Jelajahi seluruh situs web dan peroleh datanya dalam satu kali proses
Yozh Crawler memetakan seluruh struktur situs dan memproses halaman-halaman yang ditemukan. Anda akan mendapatkan cakupan yang luas serta hasil yang dapat dimanfaatkan dalam satu kali proses, tanpa perlu mengelola langkah-langkah perayapan dan penggalian data secara terpisah. Alat ini dapat diintegrasikan langsung ke dalam alur kerja pengumpulan data dan penggalian data yang sudah ada.
Yozh Crawler, terintegrasi NEW
Mulailah dari satu URL dan peta seluruh situs. Halaman-halaman akan terdeteksi dan diproses dalam satu kali proses, sehingga Anda mendapatkan cakupan penuh tanpa perlu langkah tambahan.
Mode Penjelajahan NEW
Hanya butuh tautan? Beralihlah ke mode penjelajahan dan petakan situs tanpa melakukan parsing. Lebih cepat, lebih ringan, dan berguna untuk audit serta pemeriksaan struktur.
Browser tersembunyi
Menyesuaikan header, lokasi, dan sinyal browser dengan proxy Anda. Membantu menjaga konsistensi sesi di berbagai wilayah.
Pengambilan data secara batch
Jalankan ratusan URL dalam satu permintaan. Proses semuanya secara paralel dengan satu hasil yang rapi.
Pembatalan dua tahap NEW
Hentikan proses tanpa mengganggu hasil. Biarkan halaman yang sedang aktif menyelesaikan prosesnya, atau hentikan semuanya secara instan jika diperlukan.
Integrasi MCP
Terhubung langsung dengan alat-alat seperti Claude dan Cursor. Gunakan teknik scraping dan crawling sebagai bagian dari alur kerja yang sudah ada.
10 preset bawaan
Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — cukup masukkan nama sumber dan parameternya, lalu dapatkan respons yang telah dinormalisasi. Tidak perlu menulis selektor.
Fitur pemulihan otomatis LLM NEW
Sebuah situs melakukan perubahan tata letak, dan selektor CSS Anda mengembalikan hasil kosong? Parser meminta LLM (OpenAI / Anthropic / Gemini / OpenRouter) untuk membuat ulang selektor tersebut secara instan. Pipeline tetap berjalan.
Preset yang dihasilkan oleh AI NEW
Butuh situs yang belum kami sediakan preset-nya? Jelaskan apa yang ingin diekstraksi dan tempelkan URL contoh — POST /api/v1/presets/generate akan mengembalikan JSON preset yang siap pakai.
Sesi yang terotentikasi NEW
Masuk sekali saja melalui DSL deklaratif (goto / fill / click / wait) atau tempelkan cookie yang telah diekspor. Gunakan kembali sesi tersebut pada setiap proses pengambilan data. Diperlukan untuk target yang dibatasi aksesnya, seperti preset LinkedIn.
Infrastruktur scraping sederhana yang dapat Anda kendalikan
Atur alur kerja Anda di satu tempat dan jalankan sesuai kebutuhan Anda. Semuanya jelas, teratur, dan mudah dikelola tanpa perlu alat tambahan.
Proksi bawaan, siap digunakan
Akses proxy perumahan, seluler, dan pusat data di lebih dari 120 negara. Tersedia lebih dari 50 juta alamat IP dengan tingkat ketersediaan 99,9%. Dilengkapi dengan dukungan fingerprinting untuk menyelaraskan perilaku perangkat, peramban, dan jaringan guna memastikan sesi yang stabil dan kontrol yang lebih baik.
Ekstraksi data yang fleksibel
Gunakan selektor CSS, XPath, atau fitur deteksi otomatis untuk situs-situs populer. Dapatkan data JSON yang rapi dan terstruktur tanpa perlu pengaturan yang rumit.
Semua data terpusat di satu tempat
Dapatkan kode HTML mentah, tangkapan layar, dan data yang telah diolah dalam satu tempat. Semua yang Anda butuhkan, tanpa perlu berpindah-pindah antar alat.
Pengendalian yang sederhana dan akses ke MCP
Hentikan tugas kapan saja hanya dengan satu klik dan beralih antara mode scraper dan crawler. Alur kerja Anda tetap sederhana dan tetap dalam kendali Anda.
Agen AI yang dirancang untuk web scraping dan crawling
Hubungkan Yozh Crawler dan Yozh Scraper ke Claude, Cursor, atau klien MCP mana pun. Ganti alat hanya dengan satu tombol, tanpa perlu kode tambahan.
Fitur pengambilan data dari situs web
Semua fitur Yozh Scraper tersedia sebagai fungsi untuk agen Anda, termasuk pengambilan data, eksekusi batch, dan tangkapan layar.
Satu menit untuk terhubung
Salin berkas konfigurasi, mulai ulang klien Anda, dan Anda sudah siap.
Dapat digunakan dengan klien MCP apa pun
Claude Desktop, Cursor, Cline, atau agen kustom.
Kontrol penuh atas perangkat tersebut
Pilih cara agen Anda menjalankan tugas, mulai dari satu halaman hingga seluruh batch.
Lakukan sesuai keinginanmu
Gunakan server MCP lokal atau terapkan di infrastruktur Anda sendiri.
// ~/Library/Application Support/Claude/claude_desktop_config.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cursor → Settings → MCP → Add new MCP Server { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp" }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp" } } }
// Cline → MCP Servers → Edit cline_mcp_settings.json { "mcpServers": { "yozh-scraper": { "type": "http", "url": "http://localhost:8000/mcp", "disabled": false }, "yozh-crawler": { "type": "http", "url": "http://localhost:8001/mcp", "disabled": false } } }
// Anthropic Messages API · MCP via Streamable HTTP // Note: scraper must be reachable from Anthropic's servers (deploy publicly) import Anthropic from "@anthropic-ai/sdk"; const response = await new Anthropic().messages.create({ model: "claude-opus-4-8", mcp_servers: [ { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" }, { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" } ], messages: [...] });
Menjelajahi, mengalirkan, dan mengurai halaman secara real time
Yozh Crawler memulai dari satu URL, menemukan halaman-halaman di seluruh situs, dan memprosesnya saat halaman-halaman tersebut dimuat, sehingga Anda mendapatkan struktur lengkap dan data yang dapat dimanfaatkan dalam satu kali proses.
Siaran langsung
Halaman akan muncul seiring dengan penemuan dan pemrosesannya. Akses langsung dari klien, agen, atau pipeline Anda tanpa perlu menunggu proses pemrosesan selesai sepenuhnya.
Mode Penjelajahan
Hanya butuh tautan? Lakukan pemetaan situs tanpa proses parsing. Lebih cepat dan lebih hemat biaya untuk pemeriksaan struktur dan audit.
Pembatalan dua tahap
Hentikan proses dengan aman. Biarkan halaman yang sedang aktif selesai terlebih dahulu, atau hentikan semuanya secara instan jika diperlukan.
Sakelar target MCP
Beralih antara scraper dan crawler hanya dengan satu tombol. Agen Anda akan menggunakan alat yang tepat untuk setiap tugas.
Pohon situs secara langsung di antarmuka pengguna
Lihat proses pembangunan struktur situs secara langsung. Pantau perkembangannya halaman demi halaman tanpa perlu meninggalkan dasbor.
Result
▶ Site Map (0 pages)
| URL | Parent | Depth | Status | Took |
|---|
Dari satu URL hingga cakupan seluruh situs
Crawler menemukan halaman-halaman, scraper memprosesnya, dan agen AI Anda memanfaatkan hasilnya; dirancang untuk pemula maupun ahli.
Crawler
Menemukan semua URL
Yozh Scraper
Ekstrak ke JSON
Agen AI
Menganalisis & memutuskan
Analisis persaingan
Pantau katalog, harga, dan detail produk pesaing di satu tempat. Temukan celah dalam daftar produk Anda sendiri dan tanggapi perubahan pasar dengan lebih cepat.
Pemantauan harga
Pantau perubahan harga di berbagai platform jual beli secara otomatis. Atur pemberitahuan dan dapatkan notifikasi di Telegram atau Slack saat harga berubah.
Data pelatihan ML
Mengumpulkan kumpulan data yang bersih dan terstruktur dari sumber-sumber publik, yang siap untuk dianalisis atau digunakan dalam pelatihan model. Dirancang untuk pengumpulan data yang andal dalam skala besar.
Segera mulailah melakukan scraping dengan preset yang siap pakai
Pengaturan wilayah, mata uang, pemilih, dan penanganan anti-bot — sudah dikonfigurasi. Pilih salah satu preset untuk melihat data apa saja yang diekstraksi.
Every Amazon listing, normalized
All fields below are extracted automatically — no selectors to write.
Butuh situs yang belum kami liput?
Buka tiket di GitHub atau kirimkan preset buatan Anda sendiri — kami akan meninjau pull request dalam waktu seminggu.
Proksi yang dirancang untuk pengambilan data
Tiga jenis, enam konfigurasi. Pilih berdasarkan jenis pekerjaan, kecepatan, dan anggaran.
Seluler 4G/5G
Perangkat seluler asli yang terhubung ke jaringan operator. Tingkat kepercayaan tertinggi dengan sistem anti-bot yang ketat.
Perangkat pribadi, rotasi IP manual melalui API
Satu perangkat, banyak pengguna
Pelajari lebih lanjut tentang proxy seluler
Cara kerjanya
Setiap alamat IP berasal dari smartphone asli atau modem LTE/5G yang terhubung ke operator seluler besar. Alamat IP tersebut digunakan bersama oleh ribuan pelanggan reguler, sehingga memblokirnya berarti memblokir pengguna asli — itulah sebabnya sistem anti-bot paling mempercayai alamat IP seluler.
Paling cocok untuk
- Pengelolaan akun di platform media sosial
- Upaya agresif melawan bot (Cloudflare, PerimeterX)
- Kerja afiliasi dan verifikasi iklan
- Tugas-tugas yang membutuhkan kepercayaan yang berkelanjutan layaknya manusia
Spesifikasi
- Jaringan 4G LTE dan 5G di seluruh dunia
- Dukungan UDP, konektivitas VPN VLS
- Rotasi IP manual melalui API atau tautan dasbor
- Penyesuaian sidik jari sistem operasi
- Bandwidth tak terbatas pada sebagian besar paket
Perumahan
Alamat IP dari pengguna internet rumahan asli di lebih dari 120 negara. Akses ke lebih dari 50 juta alamat IP dengan keseimbangan yang baik antara tingkat kepercayaan dan biaya.
Router asli, alamat IP tetap selama seluruh masa sewa
Kumpulan alamat IP lebih dari 100 juta, rotasi otomatis berdasarkan timer atau per permintaan
Pelajari lebih lanjut tentang proxy perumahan
Cara kerjanya
Alamat IP perumahan diperoleh dari pelanggan internet rumahan yang sesungguhnya, yang bersedia berbagi bandwidth sebagai imbalan atas kompensasi, melalui jaringan opt-in yang transparan. Koneksi mereka tampak seperti pengguna rumahan pada umumnya — karena memang demikian adanya.
Paling cocok untuk
- Web scraping dalam skala besar (titik optimal)
- Pengumpulan data pasar
- Riset SEO, pengambilan data SERP
- Pemantauan merek dan harga
- Kampanye verifikasi iklan
Spesifikasi
- Lebih dari 120 negara, lebih dari 100 juta alamat IP unik dalam kumpulan yang berganti-ganti
- Pilih mode statis atau berganti-ganti sesuai dengan tugas
- Tersedia penargetan berdasarkan kota dan ASN
- Mendukung protokol HTTPS dan SOCKS5
- Sesi tetap hingga 30 menit
Pusat Data
Kecepatan maksimal, biaya minimal. Lebih dari 2 juta alamat IP di berbagai pusat data di seluruh dunia.
Satu alamat IP yang dialokasikan untuk Anda, lalu lintas tak terbatas
Shared pool, pilihan hemat untuk pekerjaan sederhana
Pelajari lebih lanjut tentang proxy pusat data
Cara kerjanya
IP tersebut dihosting di pusat data dan tidak terhubung ke pengguna rumahan maupun pengguna seluler. Harganya lebih murah dan kecepatannya lebih tinggi daripada IP rumahan, tetapi sistem anti-bot dapat mengidentifikasinya sebagai bukan manusia, jadi gunakanlah IP tersebut di tempat-tempat di mana faktor kepercayaan tidak terlalu penting.
Paling cocok untuk
- Pengambilan data dalam volume besar dari situs-situs yang bersahabat
- Pengembangan alat internal dan pengujian beban
- Titik akhir API tanpa filter kepercayaan IP
- Tugas-tugas di mana kecepatan lebih diutamakan daripada penyamaran
Spesifikasi
- Lebih dari 2 juta alamat IPv4 dan IPv6
- Konfigurasi khusus atau bersama
- Bandwidth tak terbatas pada paket khusus
- Mendukung protokol HTTPS dan SOCKS5
- Latensi terendah di antara ketiga jenis tersebut
Etika telah menjadi bagian integral dari cara kami mengelola platform ini
Kode sumber terbuka hanyalah titik awal. Cara pengumpulan data dan cara memperoleh proxy sama pentingnya. Inilah standar yang kami terapkan dalam praktik, bukan sekadar pernyataan di atas kertas.
Pengumpulan data yang etis
Kami mengembangkan alat, bukan celah. Yozh Scraper dirancang untuk memastikan pengambilan data publik yang sah dapat dilakukan dengan andal — bukan untuk merusak hal-hal yang seharusnya tetap tertutup.
- Hanya data yang dapat diakses publik — secara default, tidak diperbolehkan melakukan scraping bagi pengguna yang sudah masuk
- Batas laju bawaan mencegah terjadinya kelebihan beban pada server
- Pemenuhan aturan robots.txt dan sitemap secara default (dapat diubah)
- Tidak ada pengumpulan atau penyimpanan PII — baik oleh kami maupun secara default bagi pengguna
- Perangkat yang membantu Anda tetap mematuhi GDPR dan CCPA
Jaringan proxy transparan
Asal usul alamat IP perumahan merupakan ujian kejujuran bagi setiap penyedia proxy. Inilah asal usul alamat IP kami — secara eksplisit:
- Jaringan berbasis persetujuan. Pengguna sungguhan memberikan persetujuan dan mendapatkan imbalan dengan berbagi bandwidth
- Anda dapat berhenti berlangganan dengan satu klik kapan saja, tanpa perlu memberikan alasan apa pun
- Rantai pasokan yang telah diaudit dengan sumber pasokan yang terdokumentasi
- Tanpa malware sama sekali, tanpa penyisipan SDK tersembunyi — sama sekali tidak pernah
- Alamat IP seluler dari perangkat yang kami miliki dan kelola, bukan dari ponsel yang diretas
Tanggapan cepat terhadap pelecehan
Jika ada yang menyalahgunakan infrastruktur kami untuk merugikan orang lain, kami ingin mengetahuinya — dan segera mengambil tindakan sebelum situasinya semakin memburuk.
- Saluran langsung ke petugas sungguhan, bukan antrean tiket
- Proses penyelidikan yang transparan untuk setiap laporan yang sah
- Kerja sama aktif dengan penegak hukum terkait kasus-kasus yang telah dikonfirmasi
- Kebijakan tentang pelecehan di ruang publik, tidak tersembunyi di balik ketentuan-ketentuan yang rumit
Jika suatu kasus penggunaan melibatkan penyalahgunaan atau kerugian, alat-alat kami tidak dirancang untuk itu. Kami lebih mengutamakan penggunaan yang bertanggung jawab daripada pertumbuhan pelanggan.
Jika suatu kasus penggunaan mengharuskan penyembunyian identitas untuk merugikan orang lain, alat-alat kami tidak diperuntukkan untuk itu. Titik. Kami lebih memilih kehilangan pelanggan daripada mengorbankan prinsip kami.
Kebijakan dan standar kami
Aturan yang jelas yang menjadi pedoman cara kami beroperasi, mulai dari pengumpulan data hingga pemilihan pihak ketiga dan penggunaan platform. Inilah kebijakan-kebijakan yang sebenarnya yang diikuti oleh tim kami, bukan sekadar ringkasan.
Kebijakan penggunaan
Menjelaskan apa yang diizinkan pada infrastruktur kami dan apa yang dibatasi, dengan alasan yang jelas.
Kebijakan penanganan penyalahgunaan
Menjelaskan bagaimana laporan ditinjau, ditangani, dan diselesaikan, termasuk waktu respons.
Standar sumber jaringan
Merinci bagaimana IP residensial dan seluler diperoleh, dengan model opt-in dan pasokan terverifikasi.
Kebijakan verifikasi pelanggan
Mencakup proses onboarding, kapan verifikasi diperlukan, dan bagaimana data pengguna dikelola.
Target yang dibatasi
Mencantumkan domain dan kasus penggunaan yang diblokir, termasuk sektor sensitif seperti pemerintahan dan keuangan.
Kebijakan penanganan data
Menjelaskan data apa yang dikumpulkan, apa yang tidak disimpan, batas retensi, dan berbagi dengan pihak ketiga.
Bagaimana tim-tim memanfaatkan
Data CyberYozh
Penerapan di dunia nyata
Pengambilan data dari web & analitik
Otomatiskan pengumpulan data publik dalam skala besar: katalog produk, penilaian, ulasan, dan data geospasial. Yozh Scraper ditambah proxy perumahan — legal, stabil, dan bersih.
Baca selengkapnya
Agen AI & otomatisasi
Buat agen otonom yang dapat mengumpulkan data, menganalisis, dan bertindak. Integrasi MCP mengubah Yozh Scraper menjadi alat bawaan untuk Claude dan Cursor — tanpa perlu integrasi khusus.
Baca selengkapnya
E-commerce & pasar daring
Pantau harga, stok, dan ketersediaan produk di Amazon, eBay, serta pasar daring lainnya di seluruh dunia. Pengaturan default ini dapat menghemat waktu pengembangan hingga berminggu-minggu.
Baca selengkapnyaApa yang dikatakan media dan kalangan bisnis
Ulasan jujur dari sumber-sumber independen
Semua artikel
AFFMaven Reviews CyberYozh's Proxy & Multi-Accounting Platform
"CyberYozh stands out as a powerful platform for affiliates and arbitrage teams, combining reliable proxy infrastructure, identity tools, and strong support in one ecosystem."
TechBullion Covers CyberYozh's B2B Platform Expansion
"CyberYozh App enables businesses to launch, test, and operate digital products across more than 30 countries through a scalable infrastructure built for global connectivity, verification, and digital operations."
Grit Daily Highlights CyberYozh's Infrastructure for Enterprise Proxy Workloads
"Built for organizations that rely on proxies every day, CyberYozh App delivers infrastructure designed for stability, scalability, and high-volume workloads rather than one-off sessions."
Disukai oleh tim data dan pengembang AI
Apa yang dikatakan oleh para pengembang yang menggunakan Yozh
Sistem preset ini adalah fitur andalannya. Kami memasukkan nama sumber dan mendapatkan respons JSON yang rapi; fitur pemulihan otomatisnya bahkan berhasil mendeteksi dua perubahan tata letak Amazon sebelum kami menyadarinya.
Akhirnya, ada scraper sumber terbuka yang memperlakukan proxy dan sesi sebagai fitur utama. Kami menjalankannya di balik sistem otentikasi untuk portal mitra — sesi tetap aktif dan hasilnya tetap konsisten di seluruh wilayah.
Setelah menghubungkannya ke Cursor melalui MCP, agen saya kini dapat mengambil data web secara langsung di tengah-tengah tugas. Proses pengambilan data streaming melalui SSE inilah yang selama ini menjadi hal yang kurang dalam alur kerja agen.
Kami beralih dari API pengambilan data berbayar untuk menghemat biaya dan bersiap menghadapi penurunan kualitas layanan — ternyata hasilnya justru sebaliknya. Sistem ini dihosting sendiri, tanpa tagihan per permintaan, dan skema outputnya lebih rapi daripada yang dulu kami bayar.
Tentang web scraping, crawling, dan agen AI
Blog dan artikel
Semua artikel
Proxy Mobile Khusus di 2026: Mengapa Tunnel UDP dan VLESS Diperlukan untuk Mengatasi DPI
Sistem deep packet inspection (DPI) secara aktif memindai dan memutus koneksi VPN standar. OpenVPN dan WireGuard gagal dalam hitungan menit. Karena keduanya bergantung pada header statis.…
Alternatif Instant Data Scraper terbaik di 2026
Bandingkan Instant Data Scraper dengan CyberYozh dan pelajari kapan crawler yang skalabel, rotasi proxy, penargetan geografis, sesi, dan otomasi menjadi diperlukan.
Proxy Mobile Terbaik untuk Otomasi Media Sosial (Reddit, Instagram, TikTok)
Menjalankan otomasi di Reddit, Instagram, atau TikTok sering kali berjalan lancar di awal, kemudian mulai bermasalah tanpa alasan yang jelas. Akun ditandai, sesi direset, atau jangkauan…
Catatan perubahan dan pembaruan web scraping
Yozh Scraper adalah perangkat lunak sumber terbuka, dengan semua pembaruan tersedia di GitHub. Berikut ini adalah fitur-fitur terbaru yang menonjol.
v0.1.8
fingerprint_profileonPOST /scrape/page,POST /scrape/pagesand the crawler/searchscrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles:auto(default, resolves toCAMOUFOX_FINGERPRINT_PROFILE, shipswindows_on_host),windows_on_host,host,random, and the bare nameswindows/macos/linux. The oldspoof_oskeeps working and equals the three bare names; a caller stating both must not name conflicting operating systems.meta.applied_fingerprintreports what actually ran, including when a profile degraded. New env varsCAMOUFOX_FINGERPRINT_PROFILE(defaultwindows_on_host) andHOST_GPU_VENDOR.- Extraction warns when a
post_processpipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet. - GitHub Actions CI:
pylintandpytest -m "not e2e"on every push and pull request, the checks the repo already defined but never enforced. run_scrapenow returns a typed envelope (ScrapeOk/ScrapeErr) built as the same pydantic models the API validates on the way out, withmypyover the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.session_id,cookiesandrenderare now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed)./searchmaps the rejection to a 400 rather than a 500.
v0.1.7 — Pin mcp<2.0 so a fresh image build starts
mcp2.0.0 madeServer.__init__keyword-only, whichfastapi-mcp0.4.x still calls positionally, so a cleandocker buildshipped services that raisedTypeErrorincreate_app()before serving anything. Bothrequirements.txtandyozh-crawler/requirements.txtnow pinmcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling oncefastapi-mcpships a release built againstmcp2.x.
v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification
- Preset extraction repaired for current site layouts:
- eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
- Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead
urlsfield. - Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
- Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so
From $19.99/Now 19.99parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 — Queue goto-timeout retry fix + dependency security updates
- The queue no longer retries a slow page as if the proxy were bad. A navigation (
goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors,net::ERR_*) still rotate and retry as before. - Dependency bumps clearing the outstanding advisories in the auxiliary tooling:
examples/(langchain-anthropic) and the localscraper-testerdev harness (express,qs,http-proxy-middleware,follow-redirects). No shipped scraper runtime or API change.
v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2
- New required services. Browsers no longer run inside the API process. You must now run the
redisandscraper-workerservices (both are already indocker-compose.yml). Scale capacity withdocker compose up -d --scale scraper-worker=N. POST /scrape/pageand/scrape/pagescan now return503 queue_fullwhen the Redis stream depth exceedsQUEUE_MAXSIZE(previously the in-memory queue was unbounded).- Removed env vars (ignored, warned at startup if set):
JOB_TIMEOUT_MS→ usePAGE_TASK_TIMEOUT_S;JOB_RESULT_MAX→ eviction is now a native Redis TTL (JOB_RESULT_TTL_S);JOBS_ENABLED→ the queue is always on. - New env vars:
REDIS_URL,PAGE_TASK_TIMEOUT_S,LOGIN_TASK_TIMEOUT_S,LOGIN_RESULT_GRACE_S,RECLAIM_IDLE_S,JOB_RESULT_TTL_S,BROWSER_MAX_PAGES,BROWSER_IDLE_SHUTDOWN_S,WARMUP_DWELL_MS. - The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The
web-scrapercontainer only enqueues page tasks and reads results; browsers run in separate, horizontally scalablescraper-workercontainers.
Mulailah melakukan web scraping dalam hitungan detik
Cukup tiga perintah, dan Anda sudah memiliki scraper + crawler yang siap dijalankan dengan titik akhir HTTP dan MCP.
git clone https://github.com/\ CyberYozh-data/yozh-scraper cd yozh-scraper
cp .env.example .env docker compose up --build
curl -X POST localhost:8000/api/v1/scrape/page \
-H 'Content-Type: application/json' \
-d '{"url":"https://example.com"}'
Hubungi kami
Seorang manusia sungguhan akan membaca semua pesan yang masuk. Pilih saluran yang paling cocok — Telegram adalah yang tercepat.
Siap mengikis?
Yozh Crawler + Scraper gratis. Selamanya. Berikan bintang jika aplikasi ini bermanfaat — setiap bintang sangat berarti.
Yozh Crawler + Scraper didistribusikan di bawah lisensi MIT. Silakan gunakan. Buat cabang (fork). Gunakan untuk mengembangkan aplikasi.