84 bintang di GitHub dan terus bertambah. Yozh Crawler + Scraper adalah perangkat lunak gratis, sumber terbuka, dan dikembangkan secara terbuka — berikan kami bintang jika alat ini layak masuk ke dalam tumpukan teknologi Anda.
v0.1.8 · Yozh Crawler sudah hadir

Pengambilan
data web yang mudah untuk agen
AI dan manusia

Salah satu alat sumber terbuka untuk pengumpulan dan penggalian data. Mulailah dari satu URL, jelajahi situs tersebut, dan peroleh data terstruktur seiring dimuatnya halaman-halaman. Dapat digunakan bersama MCP dan alat-alat seperti Claude dan Cursor, serta dilengkapi dengan pengaturan siap pakai untuk platform pasar seperti Amazon dan eBay.

84 Bintang di GitHub
MIT Lisensi · Gratis selamanya
v0.1.8 Rilis terbaru
Open Scraper Tester
Scraper URL http://localhost:8000 Check ok Crawler URL http://localhost:8001 Check ok CyberYozh API Docs ↗ Get API Key ↗
Scrape Page
Batch Scrape
Crawler
Jobs
MCP
Crawl Parameters
Seed URL *
Scope Mode
same-domain
Max Depth
3
Max Pages
47
Per-domain RPS
1.0
Per-domain
1
Include Patterns (regex, one per line)
^https://amazon\.co\.uk/dp/
Exclude Patterns (regex, one per line)
/cart|/account|/checkout
Crawl Proxy⚠ crawl proxy=none — no IP rotation
Proxy Type
none
Enable scraping (keep raw_html / screenshot / extracted data per page)
Result
crawl_________________ · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0
Crawl progress and pages will appear here...
Apa yang baru · v0.1.8

Jelajahi seluruh situs web dan peroleh datanya dalam satu kali proses

Yozh Crawler memetakan seluruh struktur situs dan memproses halaman-halaman yang ditemukan. Anda akan mendapatkan cakupan yang luas serta hasil yang dapat dimanfaatkan dalam satu kali proses, tanpa perlu mengelola langkah-langkah perayapan dan penggalian data secara terpisah. Alat ini dapat diintegrasikan langsung ke dalam alur kerja pengumpulan data dan penggalian data yang sudah ada.

Yozh Crawler, terintegrasi NEW

Mulailah dari satu URL dan peta seluruh situs. Halaman-halaman akan terdeteksi dan diproses dalam satu kali proses, sehingga Anda mendapatkan cakupan penuh tanpa perlu langkah tambahan.

Mode Penjelajahan NEW

Hanya butuh tautan? Beralihlah ke mode penjelajahan dan petakan situs tanpa melakukan parsing. Lebih cepat, lebih ringan, dan berguna untuk audit serta pemeriksaan struktur.

Browser tersembunyi

Menyesuaikan header, lokasi, dan sinyal browser dengan proxy Anda. Membantu menjaga konsistensi sesi di berbagai wilayah.

Pengambilan data secara batch

Jalankan ratusan URL dalam satu permintaan. Proses semuanya secara paralel dengan satu hasil yang rapi.

Pembatalan dua tahap NEW

Hentikan proses tanpa mengganggu hasil. Biarkan halaman yang sedang aktif menyelesaikan prosesnya, atau hentikan semuanya secara instan jika diperlukan.

Integrasi MCP

Terhubung langsung dengan alat-alat seperti Claude dan Cursor. Gunakan teknik scraping dan crawling sebagai bagian dari alur kerja yang sudah ada.

10 preset bawaan

Amazon, eBay, Walmart, Google, Google Shopping, YouTube, LinkedIn, Bing, Yandex — cukup masukkan nama sumber dan parameternya, lalu dapatkan respons yang telah dinormalisasi. Tidak perlu menulis selektor.

Fitur pemulihan otomatis LLM NEW

Sebuah situs melakukan perubahan tata letak, dan selektor CSS Anda mengembalikan hasil kosong? Parser meminta LLM (OpenAI / Anthropic / Gemini / OpenRouter) untuk membuat ulang selektor tersebut secara instan. Pipeline tetap berjalan.

Preset yang dihasilkan oleh AI NEW

Butuh situs yang belum kami sediakan preset-nya? Jelaskan apa yang ingin diekstraksi dan tempelkan URL contoh — POST /api/v1/presets/generate akan mengembalikan JSON preset yang siap pakai.

Sesi yang terotentikasi NEW

Masuk sekali saja melalui DSL deklaratif (goto / fill / click / wait) atau tempelkan cookie yang telah diekspor. Gunakan kembali sesi tersebut pada setiap proses pengambilan data. Diperlukan untuk target yang dibatasi aksesnya, seperti preset LinkedIn.

Antarmuka

Infrastruktur scraping sederhana yang dapat Anda kendalikan

Atur alur kerja Anda di satu tempat dan jalankan sesuai kebutuhan Anda. Semuanya jelas, teratur, dan mudah dikelola tanpa perlu alat tambahan.

1

Proksi bawaan, siap digunakan

Akses proxy perumahan, seluler, dan pusat data di lebih dari 120 negara. Tersedia lebih dari 50 juta alamat IP dengan tingkat ketersediaan 99,9%. Dilengkapi dengan dukungan fingerprinting untuk menyelaraskan perilaku perangkat, peramban, dan jaringan guna memastikan sesi yang stabil dan kontrol yang lebih baik.

2

Ekstraksi data yang fleksibel

Gunakan selektor CSS, XPath, atau fitur deteksi otomatis untuk situs-situs populer. Dapatkan data JSON yang rapi dan terstruktur tanpa perlu pengaturan yang rumit.

3

Semua data terpusat di satu tempat

Dapatkan kode HTML mentah, tangkapan layar, dan data yang telah diolah dalam satu tempat. Semua yang Anda butuhkan, tanpa perlu berpindah-pindah antar alat.

4

Pengendalian yang sederhana dan akses ke MCP

Hentikan tugas kapan saja hanya dengan satu klik dan beralih antara mode scraper dan crawler. Alur kerja Anda tetap sederhana dan tetap dalam kendali Anda.

MCP · Protokol Konteks Model

Agen AI yang dirancang untuk web scraping dan crawling

Hubungkan Yozh Crawler dan Yozh Scraper ke Claude, Cursor, atau klien MCP mana pun. Ganti alat hanya dengan satu tombol, tanpa perlu kode tambahan.

Fitur pengambilan data dari situs web

Semua fitur Yozh Scraper tersedia sebagai fungsi untuk agen Anda, termasuk pengambilan data, eksekusi batch, dan tangkapan layar.

Satu menit untuk terhubung

Salin berkas konfigurasi, mulai ulang klien Anda, dan Anda sudah siap.

Dapat digunakan dengan klien MCP apa pun

Claude Desktop, Cursor, Cline, atau agen kustom.

Kontrol penuh atas perangkat tersebut

Pilih cara agen Anda menjalankan tugas, mulai dari satu halaman hingga seluruh batch.

Lakukan sesuai keinginanmu

Gunakan server MCP lokal atau terapkan di infrastruktur Anda sendiri.

// ~/Library/Application Support/Claude/claude_desktop_config.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cursor → Settings → MCP → Add new MCP Server
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp"
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp"
    }
  }
}
// Cline → MCP Servers → Edit cline_mcp_settings.json
{
  "mcpServers": {
    "yozh-scraper": {
      "type": "http",
      "url":  "http://localhost:8000/mcp",
      "disabled": false
    },
    "yozh-crawler": {
      "type": "http",
      "url":  "http://localhost:8001/mcp",
      "disabled": false
    }
  }
}
// Anthropic Messages API · MCP via Streamable HTTP
// Note: scraper must be reachable from Anthropic's servers (deploy publicly)
import Anthropic from "@anthropic-ai/sdk";

const response = await new Anthropic().messages.create({
  model: "claude-opus-4-8",
  mcp_servers: [
    { type: "url", url: "https://your-host/mcp", name: "yozh-scraper" },
    { type: "url", url: "https://your-host:8001/mcp", name: "yozh-crawler" }
  ],
  messages: [...]
});
Panduan Integrasi MCP Lengkap
Yozh Crawler · v0.1.8

Menjelajahi, mengalirkan, dan mengurai halaman secara real time

Yozh Crawler memulai dari satu URL, menemukan halaman-halaman di seluruh situs, dan memprosesnya saat halaman-halaman tersebut dimuat, sehingga Anda mendapatkan struktur lengkap dan data yang dapat dimanfaatkan dalam satu kali proses.

Siaran langsung

Halaman akan muncul seiring dengan penemuan dan pemrosesannya. Akses langsung dari klien, agen, atau pipeline Anda tanpa perlu menunggu proses pemrosesan selesai sepenuhnya.

Mode Penjelajahan

Hanya butuh tautan? Lakukan pemetaan situs tanpa proses parsing. Lebih cepat dan lebih hemat biaya untuk pemeriksaan struktur dan audit.

Pembatalan dua tahap

Hentikan proses dengan aman. Biarkan halaman yang sedang aktif selesai terlebih dahulu, atau hentikan semuanya secara instan jika diperlukan.

Sakelar target MCP

Beralih antara scraper dan crawler hanya dengan satu tombol. Agen Anda akan menggunakan alat yang tepat untuk setiap tugas.

Pohon situs secara langsung di antarmuka pengguna

Lihat proses pembangunan struktur situs secara langsung. Pantau perkembangannya halaman demi halaman tanpa perlu meninggalkan dasbor.

Result

crawl_a8f3c124b6e0d7 · status: idle · visited: 0 / 30 · queued: 0 · failed: 0 · dedup: 0 · out-of-scope: 0 · retries: 0
Site Map (0 pages)

                    
URL Parent Depth Status Took
Paket · Crawler + Scraper

Dari satu URL hingga cakupan seluruh situs

Crawler menemukan halaman-halaman, scraper memprosesnya, dan agen AI Anda memanfaatkan hasilnya; dirancang untuk pemula maupun ahli.

Crawler

Menemukan semua URL

Yozh Scraper

Ekstrak ke JSON

Agen AI

Menganalisis & memutuskan

Analisis persaingan

Pantau katalog, harga, dan detail produk pesaing di satu tempat. Temukan celah dalam daftar produk Anda sendiri dan tanggapi perubahan pasar dengan lebih cepat.

Crawler JSON AI

Pemantauan harga

Pantau perubahan harga di berbagai platform jual beli secara otomatis. Atur pemberitahuan dan dapatkan notifikasi di Telegram atau Slack saat harga berubah.

Batch Jadwal Pemberitahuan

Data pelatihan ML

Mengumpulkan kumpulan data yang bersih dan terstruktur dari sumber-sumber publik, yang siap untuk dianalisis atau digunakan dalam pelatihan model. Dirancang untuk pengumpulan data yang andal dalam skala besar.

Stealth Proxy JSON
Pengaturan default marketplace & situs

Segera mulailah melakukan scraping dengan preset yang siap pakai

Pengaturan wilayah, mata uang, pemilih, dan penanganan anti-bot — sudah dikonfigurasi. Pilih salah satu preset untuk melihat data apa saja yang diekstraksi.

10 preset bawaan · LLM dapat memperbaiki diri sendiri saat tata letak situs berubah · buat preset Anda sendiri dari URL contoh Ajukan permintaan preset →

            

Every Amazon listing, normalized

All fields below are extracted automatically — no selectors to write.

Butuh situs yang belum kami liput?

Buka tiket di GitHub atau kirimkan preset buatan Anda sendiri — kami akan meninjau pull request dalam waktu seminggu.

Buka laporan masalah
Proksi

Proksi yang dirancang untuk pengambilan data

Tiga jenis, enam konfigurasi. Pilih berdasarkan jenis pekerjaan, kecepatan, dan anggaran.

Seluler 4G/5G

Perangkat seluler asli yang terhubung ke jaringan operator. Tingkat kepercayaan tertinggi dengan sistem anti-bot yang ketat.

Pribadi dan khusus from $1.7/day

Perangkat pribadi, rotasi IP manual melalui API

Dibagikan from $0.9/day

Satu perangkat, banyak pengguna

Pelajari lebih lanjut tentang proxy seluler
Cara kerjanya

Setiap alamat IP berasal dari smartphone asli atau modem LTE/5G yang terhubung ke operator seluler besar. Alamat IP tersebut digunakan bersama oleh ribuan pelanggan reguler, sehingga memblokirnya berarti memblokir pengguna asli — itulah sebabnya sistem anti-bot paling mempercayai alamat IP seluler.

Paling cocok untuk
  • Pengelolaan akun di platform media sosial
  • Upaya agresif melawan bot (Cloudflare, PerimeterX)
  • Kerja afiliasi dan verifikasi iklan
  • Tugas-tugas yang membutuhkan kepercayaan yang berkelanjutan layaknya manusia
Spesifikasi
  • Jaringan 4G LTE dan 5G di seluruh dunia
  • Dukungan UDP, konektivitas VPN VLS
  • Rotasi IP manual melalui API atau tautan dasbor
  • Penyesuaian sidik jari sistem operasi
  • Bandwidth tak terbatas pada sebagian besar paket

Pusat Data

Kecepatan maksimal, biaya minimal. Lebih dari 2 juta alamat IP di berbagai pusat data di seluruh dunia.

Statis khusus from $1.9/mo

Satu alamat IP yang dialokasikan untuk Anda, lalu lintas tak terbatas

Statis bersama from $0.5/mo

Shared pool, pilihan hemat untuk pekerjaan sederhana

Pelajari lebih lanjut tentang proxy pusat data
Cara kerjanya

IP tersebut dihosting di pusat data dan tidak terhubung ke pengguna rumahan maupun pengguna seluler. Harganya lebih murah dan kecepatannya lebih tinggi daripada IP rumahan, tetapi sistem anti-bot dapat mengidentifikasinya sebagai bukan manusia, jadi gunakanlah IP tersebut di tempat-tempat di mana faktor kepercayaan tidak terlalu penting.

Paling cocok untuk
  • Pengambilan data dalam volume besar dari situs-situs yang bersahabat
  • Pengembangan alat internal dan pengujian beban
  • Titik akhir API tanpa filter kepercayaan IP
  • Tugas-tugas di mana kecepatan lebih diutamakan daripada penyamaran
Spesifikasi
  • Lebih dari 2 juta alamat IPv4 dan IPv6
  • Konfigurasi khusus atau bersama
  • Bandwidth tak terbatas pada paket khusus
  • Mendukung protokol HTTPS dan SOCKS5
  • Latensi terendah di antara ketiga jenis tersebut
Pilih proxy yang sesuai dengan kebutuhan Anda → Harus masuk
Etika · Tidak dapat dinegosiasikan

Etika telah menjadi bagian integral dari cara kami mengelola platform ini

Kode sumber terbuka hanyalah titik awal. Cara pengumpulan data dan cara memperoleh proxy sama pentingnya. Inilah standar yang kami terapkan dalam praktik, bukan sekadar pernyataan di atas kertas.

Pengumpulan data yang etis

Kami mengembangkan alat, bukan celah. Yozh Scraper dirancang untuk memastikan pengambilan data publik yang sah dapat dilakukan dengan andal — bukan untuk merusak hal-hal yang seharusnya tetap tertutup.

  • Hanya data yang dapat diakses publik — secara default, tidak diperbolehkan melakukan scraping bagi pengguna yang sudah masuk
  • Batas laju bawaan mencegah terjadinya kelebihan beban pada server
  • Pemenuhan aturan robots.txt dan sitemap secara default (dapat diubah)
  • Tidak ada pengumpulan atau penyimpanan PII — baik oleh kami maupun secara default bagi pengguna
  • Perangkat yang membantu Anda tetap mematuhi GDPR dan CCPA

Jaringan proxy transparan

Asal usul alamat IP perumahan merupakan ujian kejujuran bagi setiap penyedia proxy. Inilah asal usul alamat IP kami — secara eksplisit:

  • Jaringan berbasis persetujuan. Pengguna sungguhan memberikan persetujuan dan mendapatkan imbalan dengan berbagi bandwidth
  • Anda dapat berhenti berlangganan dengan satu klik kapan saja, tanpa perlu memberikan alasan apa pun
  • Rantai pasokan yang telah diaudit dengan sumber pasokan yang terdokumentasi
  • Tanpa malware sama sekali, tanpa penyisipan SDK tersembunyi — sama sekali tidak pernah
  • Alamat IP seluler dari perangkat yang kami miliki dan kelola, bukan dari ponsel yang diretas

Tanggapan cepat terhadap pelecehan

Jika ada yang menyalahgunakan infrastruktur kami untuk merugikan orang lain, kami ingin mengetahuinya — dan segera mengambil tindakan sebelum situasinya semakin memburuk.

  • Saluran langsung ke petugas sungguhan, bukan antrean tiket
  • Proses penyelidikan yang transparan untuk setiap laporan yang sah
  • Kerja sama aktif dengan penegak hukum terkait kasus-kasus yang telah dikonfirmasi
  • Kebijakan tentang pelecehan di ruang publik, tidak tersembunyi di balik ketentuan-ketentuan yang rumit
abuse-reports@cyberyozh.com
Average response time: 45 menit

Jika suatu kasus penggunaan melibatkan penyalahgunaan atau kerugian, alat-alat kami tidak dirancang untuk itu. Kami lebih mengutamakan penggunaan yang bertanggung jawab daripada pertumbuhan pelanggan.

Jika suatu kasus penggunaan mengharuskan penyembunyian identitas untuk merugikan orang lain, alat-alat kami tidak diperuntukkan untuk itu. Titik. Kami lebih memilih kehilangan pelanggan daripada mengorbankan prinsip kami.

Disukai oleh tim data dan pengembang AI

Apa yang dikatakan oleh para pengembang yang menggunakan Yozh

5.0 / 5 · Ulasan 5
GitHub
Dalam satu sore, kami mengganti klaster Playwright internal kami dengan Yozh. Titik akhir MCP langsung terintegrasi ke dalam agen Claude kami — tanpa perlu kode penghubung sama sekali, crawler dan scraper langsung berfungsi dengan baik.
Marcus Reinhardt Insinyur Data Utama Northwind Analytics
X
Sistem preset ini adalah fitur andalannya. Kami memasukkan nama sumber dan mendapatkan respons JSON yang rapi; fitur pemulihan otomatisnya bahkan berhasil mendeteksi dua perubahan tata letak Amazon sebelum kami menyadarinya.
Priya Nair Pendiri ScrapeStack
Reddit
Akhirnya, ada scraper sumber terbuka yang memperlakukan proxy dan sesi sebagai fitur utama. Kami menjalankannya di balik sistem otentikasi untuk portal mitra — sesi tetap aktif dan hasilnya tetap konsisten di seluruh wilayah.
Daniel Osei Insinyur Backend Loopfeed
X
Setelah menghubungkannya ke Cursor melalui MCP, agen saya kini dapat mengambil data web secara langsung di tengah-tengah tugas. Proses pengambilan data streaming melalui SSE inilah yang selama ini menjadi hal yang kurang dalam alur kerja agen.
Elena Kovac Insinyur Kecerdasan Buatan Vektor Labs
GitHub
Kami beralih dari API pengambilan data berbayar untuk menghemat biaya dan bersiap menghadapi penurunan kualitas layanan — ternyata hasilnya justru sebaliknya. Sistem ini dihosting sendiri, tanpa tagihan per permintaan, dan skema outputnya lebih rapi daripada yang dulu kami bayar.
Sofia Almeida Manajer Teknik Tabbly
Daftar Perubahan

Catatan perubahan dan pembaruan web scraping

Yozh Scraper adalah perangkat lunak sumber terbuka, dengan semua pembaruan tersedia di GitHub. Berikut ini adalah fitur-fitur terbaru yang menonjol.

v0.1.8 10 Agustus 2026 Latest

v0.1.8

  • fingerprint_profile on POST /scrape/page, POST /scrape/pages and the crawler/search scrape_options: pin the Camoufox fingerprint's OS and WebGL vendor instead of Camoufox's per-launch random draw (which claimed an OS the server is not two launches in three). Profiles: auto (default, resolves to CAMOUFOX_FINGERPRINT_PROFILE, ships windows_on_host), windows_on_host, host, random, and the bare names windows / macos / linux. The old spoof_os keeps working and equals the three bare names; a caller stating both must not name conflicting operating systems. meta.applied_fingerprint reports what actually ran, including when a profile degraded. New env vars CAMOUFOX_FINGERPRINT_PROFILE (default windows_on_host) and HOST_GPU_VENDOR.
  • Extraction warns when a post_process pipeline nulls an entire column (every row) — a fourth class of silent failure the invalid/empty/length-mismatch selector checks did not cover. Reported only for a fully-nulled column with more than one row, or a scalar field; an optional value missing on a single row stays quiet.
  • GitHub Actions CI: pylint and pytest -m "not e2e" on every push and pull request, the checks the repo already defined but never enforced.
  • run_scrape now returns a typed envelope (ScrapeOk / ScrapeErr) built as the same pydantic models the API validates on the way out, with mypy over the queue surface. An older worker meeting a metadata value a newer API introduced degrades that field and keeps the fetched page, rather than dropping it. Internal refactor; the public HTTP response is unchanged.
  • session_id, cookies and render are now rejected with 422 on the Camoufox engine instead of being accepted and silently ignored (which returned a logged-out or non-rendered page that read as the site having changed). /search maps the rejection to a 400 rather than a 500.
v0.1.7 4 Agustus 2026

v0.1.7 — Pin mcp<2.0 so a fresh image build starts

  • mcp 2.0.0 made Server.__init__ keyword-only, which fastapi-mcp 0.4.x still calls positionally, so a clean docker build shipped services that raised TypeError in create_app() before serving anything. Both requirements.txt and yozh-crawler/requirements.txt now pin mcp>=1.28.1,<2. The floor keeps the fix for GHSA-vj7q-gjh5-988w (HIGH — WebSocket Host/Origin validation). Drop the ceiling once fastapi-mcp ships a release built against mcp 2.x.
v0.1.6 29 Juli 2026

v0.1.6 — Extraction/preset fixes (eBay, Walmart, Yandex, price) + selector-timeout classification

  • Preset extraction repaired for current site layouts:
  • eBay search — new s-card layout; price regex hardened against the was-price / prefix-class / nested-tag traps.
  • Walmart — recovered price and rating extraction (anchored so a strikethrough "was" price can't win); dropped google_shopping's dead urls field.
  • Yandex search — one row per organic block, so titles, links and snippets no longer drift out of alignment (a title could previously come back paired with the wrong result's link).
  • Price parsing no longer lets a label before the price swallow it: a leading digit is now required, so From $19.99 / Now 19.99 parse the number rather than the label. Currency symbols, thousands separators (US and EU), leading decimals and negatives still parse as before.
v0.1.5 24 Juli 2026

v0.1.5 — Queue goto-timeout retry fix + dependency security updates

  • The queue no longer retries a slow page as if the proxy were bad. A navigation (goto) timeout — the page was simply slow, the proxy is fine — used to burn the retry budget and rotate the proxy; it now gets one rotation at most and otherwise returns a timeout to the caller instead of looping. Genuine proxy failures (connection reset, tunnel/auth errors, net::ERR_*) still rotate and retry as before.
  • Dependency bumps clearing the outstanding advisories in the auxiliary tooling: examples/ (langchain-anthropic) and the local scraper-tester dev harness (express, qs, http-proxy-middleware, follow-redirects). No shipped scraper runtime or API change.
v0.1.0 9 Juli 2026 First release

v0.1.0 - Durable queue, Camoufox engine & CyberYozh proxy v2

  • New required services. Browsers no longer run inside the API process. You must now run the redis and scraper-worker services (both are already in docker-compose.yml). Scale capacity with docker compose up -d --scale scraper-worker=N.
  • POST /scrape/page and /scrape/pages can now return 503 queue_full when the Redis stream depth exceeds QUEUE_MAXSIZE (previously the in-memory queue was unbounded).
  • Removed env vars (ignored, warned at startup if set): JOB_TIMEOUT_MS → use PAGE_TASK_TIMEOUT_S; JOB_RESULT_MAX → eviction is now a native Redis TTL (JOB_RESULT_TTL_S); JOBS_ENABLED → the queue is always on.
  • New env vars: REDIS_URL, PAGE_TASK_TIMEOUT_S, LOGIN_TASK_TIMEOUT_S, LOGIN_RESULT_GRACE_S, RECLAIM_IDLE_S, JOB_RESULT_TTL_S, BROWSER_MAX_PAGES, BROWSER_IDLE_SHUTDOWN_S, WARMUP_DWELL_MS.
  • The in-process job queue and browser worker pool are replaced by a taskiq stream on Redis. The web-scraper container only enqueues page tasks and reads results; browsers run in separate, horizontally scalable scraper-worker containers.
Panduan Cepat

Mulailah melakukan web scraping dalam hitungan detik

Cukup tiga perintah, dan Anda sudah memiliki scraper + crawler yang siap dijalankan dengan titik akhir HTTP dan MCP.

1 Klon
git clone https://github.com/\
  CyberYozh-data/yozh-scraper
cd yozh-scraper
2 Lari
cp .env.example .env
docker compose up --build
3 Mengikis
curl -X POST localhost:8000/api/v1/scrape/page \
  -H 'Content-Type: application/json' \
  -d '{"url":"https://example.com"}'
Dokumentasi lengkap Hubungkan ke Claude / Cursor melalui MCP →
Kontak · Dukungan

Hubungi kami

Seorang manusia sungguhan akan membaca semua pesan yang masuk. Pilih saluran yang paling cocok — Telegram adalah yang tercepat.

Kantor
Jurija Gagarina 231/329
Novi Beograd · Serbia
Layanan dukungan dua tingkatan, hampir sepanjang waktu Tim garis depan bertugas hampir 24 jam sehari, 7 hari seminggu. Insinyur senior menangani kasus-kasus yang rumit.
Sumber Terbuka · Lisensi MIT · 84 ★

Siap mengikis?

Yozh Crawler + Scraper gratis. Selamanya. Berikan bintang jika aplikasi ini bermanfaat — setiap bintang sangat berarti.

Yozh Crawler + Scraper didistribusikan di bawah lisensi MIT. Silakan gunakan. Buat cabang (fork). Gunakan untuk mengembangkan aplikasi.