¿Con qué plataformas de venta online trabajáis?
10 preajustes integrados que src/presets/builtin/ que abarcan las principales fuentes de datos: amazon_product (EE. UU., Reino Unido, Alemania, Francia, Japón), amazon_search (EE. UU., Reino Unido, Alemania), ebay_search (EE. UU., Reino Unido, Alemania), walmart_product (EE. UU.), google_search (EE. UU., Reino Unido, Alemania, Francia, Rusia, Japón), google_shopping (EE. UU., Reino Unido, Alemania), bing_search (EE. UU., Reino Unido, Alemania, Francia, Rusia, Japón), yandex_search (EE. UU., Reino Unido, Alemania, Francia, Rusia, Japón), youtube_video (global), linkedin_profile (global, requiere session_id). ¿Necesitas algo más? Utiliza POST /api/v1/presets/generate con una URL de ejemplo: un modelo de lenguaje grande (LLM) deducirá el esquema y generará los selectores por ti.
¿Qué grado de estabilidad tiene el esquema?
La misma estructura de campos en todas las regiones y configuraciones predefinidas — amazon_product en .us, .uk, .de, .fr y .jp se devuelven claves idénticas (moneda localizada, estructura sin cambios). Los campos opcionales son explícitamente nulos, por lo que los valores que falten nunca afectarán a tu analizador. Cuando un mercado cambia de diseño, la autorreparación de LLM regenera el selector sobre la marcha (indícalo llm: {model: "..."} en la solicitud)—; el proceso sigue ejecutándose con un self_heal: true indicador en la respuesta. Los cambios que rompen la compatibilidad solo se lanzan en versiones menores con notas de migración en CHANGELOG.md.
¿Puedo extraer datos de Amazon, eBay o Walmart?
Sí, los tres son ajustes predefinidos de primera clase, sin necesidad de configuración adicional. Amazon ofrece datos para cinco mercados regionales (us, uk, de, fr, jp) en las páginas de detalles del producto (PDP) y en la búsqueda; eBay cubre la búsqueda en us, uk y de; y Walmart .us, las páginas de productos. Cada uno devuelve el mismo formato JSON: title, price, currency, in_stock, rating, seller, además de campos específicos de cada mercado cuando existan (ASIN, ganador de la Buy Box, indicador de anuncio patrocinado). Para los datos vinculados a la cuenta tras iniciar sesión (precios de Prime, portales de socios), utiliza la API de sesiones y envía session_id con la solicitud.
¿En cuánto tiempo podré disponer de los primeros datos?
Aproximadamente 5 minutos de principio a fin. git clone + docker compose up -d Pone en marcha el scraper en unos 30 segundos (Docker descarga la imagen una vez). En primer lugar curl POST /api/v1/scrape/preset/page devuelve datos JSON estructurados en 1–3 segundos para las configuraciones regionales almacenadas en caché, y en un máximo de 5–8 segundos si se inicia en frío. Sin necesidad de registrarse, sin crear claves API, sin medición de uso de SaaS: accedes al punto final localhost:8000 en cuanto el contenedor esté operativo.
¿Os ocupáis de los proxies y de la protección contra bots?
Sí. El scraper se integra con el CyberYozh App Proxy a través de CYBERYOZH_API_KEY — 5 tipos de proxy en 250 códigos de país (residencial rotativo/fijo, móvil 4G/5G, centro de datos, ISP). La protección antibot se gestiona mediante una versión de Chromium sigilosa con huella digital «caliente», que se adapta al proxy residencial y con tiempos de respuesta similares a los de un humano; la mayoría de los flujos evitan por completo el CAPTCHA. Cuando aparece un CAPTCHA, el rastreador lo devuelve como un error estructurado en lugar de resolverlo de forma silenciosa. Regla general: proxies residenciales rotativos para el rastreo a escala de catálogo; móviles para zonas con protección antibot agresiva o tareas vinculadas a cuentas.