Que plataformas de comércio eletrónico suportam?
10 predefinições integradas que src/presets/builtin/ que abrangem as principais fontes de dados: amazon_product (us, uk, de, fr, jp), amazon_search (us, uk, de), ebay_search (EUA, Reino Unido, Alemanha), walmart_product (EUA), google_search (EUA, Reino Unido, Alemanha, França, Rússia, Japão), google_shopping (EUA, Reino Unido, Alemanha), bing_search (EUA, Reino Unido, Alemanha, França, Rússia, Japão), yandex_search (EUA, Reino Unido, Alemanha, França, Rússia, Japão), youtube_video (global), linkedin_profile (global, requer session_id). Precisa de mais alguma coisa? Utilize POST /api/v1/presets/generate com um URL de exemplo — um LLM infere o esquema e gera seletores para si.
Até que ponto o esquema é estável?
A forma dos campos é idêntica em todas as regiões e predefinições — amazon_product em .us, .uk, .de, .fr e .jp, todos devolvem as mesmas chaves (moeda localizada, estrutura inalterada). Os campos opcionais são explicitamente nulos, pelo que a ausência de valores nunca prejudica o seu analisador. Quando um mercado altera o layout, a autocorreção do LLM regenera o seletor em tempo real (basta llm: {model: "..."} na solicitação) — o pipeline continua a funcionar com um self_heal: true bandeira na resposta. As alterações que causam incompatibilidade só são lançadas em versões secundárias, com notas de migração em CHANGELOG.md.
Posso fazer scraping na Amazon, no eBay e no Walmart?
Sim — todas as três são predefinições de primeira classe, sem necessidade de configuração adicional. A Amazon disponibiliza dados em 5 regiões (us, uk, de, fr, jp) para as páginas de detalhes do produto (PDP) e para a pesquisa; o eBay abrange a pesquisa nos mercados us/uk/de; e o Walmart .us para as páginas de produtos. Cada uma devolve o mesmo formato JSON: title, price, currency, in_stock, rating, seller, além de campos específicos de cada marketplace, quando existentes (ASIN, vencedor da Buy Box, indicador de anúncio patrocinado). Para dados associados à conta que requerem início de sessão (preços Prime, portais de parceiros), utilize a API Sessions e inclua session_id juntamente com o pedido.
Em quanto tempo posso obter os primeiros dados?
Cerca de 5 minutos, do início ao fim. git clone + docker compose up -d coloca o scraper online em cerca de 30 segundos (o Docker faz o pull da imagem uma vez). Inicialmente curl POST /api/v1/scrape/preset/page retorna JSON estruturado em 1 a 3 segundos para localizações em cache, até 5 a 8 segundos quando o sistema está a arrancar. Sem registo, sem criação de chave de API, sem medição de SaaS — acede-se ao endpoint localhost:8000 no momento em que o contentor estiver operacional.
Trata de proxies e de medidas anti-bot?
Sim. O scraper integra-se com o CyberYozh App Proxy através de CYBERYOZH_API_KEY — 5 tipos de proxy em 250 códigos de país (residenciais rotativos/fixos, móveis 4G/5G, centro de dados, ISP). A proteção anti-bot é gerida por uma versão discreta do Chromium com «warm fingerprint», proxy residencial correspondente e temporização semelhante à humana — a maioria dos fluxos evita completamente o CAPTCHA. Quando surge um CAPTCHA, o scraper devolve-o como um erro estruturado, em vez de o resolver silenciosamente. Regra geral: proxies residenciais rotativos para scraping à escala de catálogo; móveis para zonas com proteção anti-bot agressiva ou tarefas ligadas a contas específicas.