Pular para o conteúdo principal

Raspagem de conteúdo

Configure como o ChattyBox rastreia seu site e indexa o conteúdo para respostas de IA.

Para uma implementação de conteúdo público, consulte o guia de chatbot de IA para sites para saber como escolher documentação confiável, artigos de ajuda, páginas de produtos e perguntas frequentes antes de testar respostas com citações.

Modos de raspagem

O ChattyBox oferece quatro modos: homepage, sitemap, crawl e URLs manuais. Obtém HTML público, não executa JavaScript nem aplica robots.txt; não suporta login, CAPTCHA ou conteúdo privado.

1. Apenas a página inicial

Raspa apenas sua página inicial. Ideal para landing pages simples ou quando você quer indexar o mínimo de conteúdo.

2. Modo sitemap (Recomendado)

Forneça uma sitemap para descobrir páginas da mesma origem. Limites de páginas, filtros e orçamento de atualização continuam a aplicar-se; uma sitemap não garante indexação de todas as URLs.

https://example.com/sitemap.xml

3. Crawl

Primeiro tenta /sitemap.xml e /sitemap_index.xml; só se não houver URLs segue links da mesma origem até à profundidade configurada. Não preenche uma sitemap incompleta com links.

4. URLs manuais

Especifique as URLs exatas para raspar, uma por linha. Use isso quando quiser ter controle preciso sobre quais páginas são indexadas.

https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq

Limites de páginas

maxPages guarda o pedido; cada execução limita a descoberta e seleção de saída a min(pedido, max(capacidade atual de páginas do fornecedor, páginas existentes conhecidas do projeto)). Com capacidade zero ou negada, apenas páginas existentes conhecidas podem ser atualizadas; sem elas não há descoberta de saída de páginas desconhecidas. Isto não altera os direitos do pool do proprietário.

Páginas armazenadas e trabalho mensal de atualização são limites distintos. Free tem 500 unidades mensais, Starter 5.000, Pro 100.000 e Business 250.000; Free atualiza semanalmente e os planos pagos diariamente. Scrape manual e PAYG não eliminam cooldown ou orçamento.

PlanoPáginas incluídas
Free10
Starter150
Pro5,000
Business25,000

Extração de conteúdo

Completed só significa que o job terminou: compare Content e contagens com as URLs esperadas. Embeddings são um job separado; Partially indexed indica texto além de 512 KiB UTF-8, do qual só o início é guardado.

ChattyBox lê o título e prefere <main>, depois <article>, depois role="main", com fallback ao body. Extrai:

  • Título da página - A tag <title>
  • Conteúdo principal - Texto de <main>, <article> ou <body>
  • Títulos - Todas as tags <h1> a <h6>
  • Parágrafos - Todo o conteúdo de <p>
  • Listas - Itens de <ul> e <ol>

Conteúdo ignorado

ChattyBox ignora automaticamente:

  • Menus de navegação
  • Conteúdo do rodapé
  • Scripts e estilos
  • Elementos ocultos
  • Banners de cookies

Resolução de problemas

As páginas não estão sendo raspadas?

  • Verifique se a URL está publicamente acessível
  • Verifique pedidos HTML públicos sem login, CAPTCHA ou desafio de bots; robots.txt não é consultado
  • Verifique se a página não exige autenticação

Conteúdo ausente nas respostas?

  • Raspe a página novamente para obter o conteúdo mais recente
  • Sirva o texto importante no HTML inicial: JavaScript não é renderizado
  • Certifique-se de que o conteúdo esteja no corpo principal, não em iframes

Precisa de mais controle?

Para necessidades avançadas de raspagem (autenticação, conteúdo dinâmico etc.), entre em contato pelo support@chattybox.ai.

Utilizamos ferramentas opcionais de análise e gestão de tags para compreender a utilização do site. Escolha se pretende permitir o Ahrefs Web Analytics, o PostHog e o Google Tag Manager. Ao desativar a análise, esta página será recarregada para que a alteração seja aplicada corretamente. A funcionalidade essencial do site e a monitorização de erros não são controladas por esta escolha. Leia a nossa política de privacidade.