Raspagem de conteúdo
Configure como o ChattyBox rastreia seu site e indexa o conteúdo para respostas de IA.
Para uma implementação de conteúdo público, consulte o guia de chatbot de IA para sites para saber como escolher documentação confiável, artigos de ajuda, páginas de produtos e perguntas frequentes antes de testar respostas com citações.
Modos de raspagem
O ChattyBox oferece quatro modos: homepage, sitemap, crawl e URLs manuais. Obtém HTML público, não executa JavaScript nem aplica robots.txt; não suporta login, CAPTCHA ou conteúdo privado.
1. Apenas a página inicial
Raspa apenas sua página inicial. Ideal para landing pages simples ou quando você quer indexar o mínimo de conteúdo.
2. Modo sitemap (Recomendado)
Forneça uma sitemap para descobrir páginas da mesma origem. Limites de páginas, filtros e orçamento de atualização continuam a aplicar-se; uma sitemap não garante indexação de todas as URLs.
https://example.com/sitemap.xml
3. Crawl
Primeiro tenta /sitemap.xml e /sitemap_index.xml; só se não houver URLs segue links da mesma origem até à profundidade configurada. Não preenche uma sitemap incompleta com links.
4. URLs manuais
Especifique as URLs exatas para raspar, uma por linha. Use isso quando quiser ter controle preciso sobre quais páginas são indexadas.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Limites de páginas
maxPages guarda o pedido; cada execução limita a descoberta e seleção de saída a min(pedido, max(capacidade atual de páginas do fornecedor, páginas existentes conhecidas do projeto)). Com capacidade zero ou negada, apenas páginas existentes conhecidas podem ser atualizadas; sem elas não há descoberta de saída de páginas desconhecidas. Isto não altera os direitos do pool do proprietário.
Páginas armazenadas e trabalho mensal de atualização são limites distintos. Free tem 500 unidades mensais, Starter 5.000, Pro 100.000 e Business 250.000; Free atualiza semanalmente e os planos pagos diariamente. Scrape manual e PAYG não eliminam cooldown ou orçamento.
| Plano | Páginas incluídas |
|---|---|
| Free | 10 |
| Starter | 150 |
| Pro | 5,000 |
| Business | 25,000 |
Extração de conteúdo
Completed só significa que o job terminou: compare Content e contagens com as URLs esperadas. Embeddings são um job separado; Partially indexed indica texto além de 512 KiB UTF-8, do qual só o início é guardado.
ChattyBox lê o título e prefere <main>, depois <article>, depois role="main", com fallback ao body. Extrai:
- Título da página - A tag
<title> - Conteúdo principal - Texto de
<main>,<article>ou<body> - Títulos - Todas as tags
<h1>a<h6> - Parágrafos - Todo o conteúdo de
<p> - Listas - Itens de
<ul>e<ol>
Conteúdo ignorado
ChattyBox ignora automaticamente:
- Menus de navegação
- Conteúdo do rodapé
- Scripts e estilos
- Elementos ocultos
- Banners de cookies
Resolução de problemas
As páginas não estão sendo raspadas?
- Verifique se a URL está publicamente acessível
- Verifique pedidos HTML públicos sem login, CAPTCHA ou desafio de bots;
robots.txtnão é consultado - Verifique se a página não exige autenticação
Conteúdo ausente nas respostas?
- Raspe a página novamente para obter o conteúdo mais recente
- Sirva o texto importante no HTML inicial: JavaScript não é renderizado
- Certifique-se de que o conteúdo esteja no corpo principal, não em iframes
Precisa de mais controle?
Para necessidades avançadas de raspagem (autenticação, conteúdo dinâmico etc.), entre em contato pelo support@chattybox.ai.