Extracción de contenido
Configura cómo ChattyBox rastrea tu sitio web e indexa el contenido para las respuestas de IA.
Para un despliegue de contenido público, consulta la guía del chatbot de IA para sitios web sobre cómo elegir documentación fiable, artículos de ayuda, páginas de productos y preguntas frecuentes antes de probar respuestas con citas.
Modos de scraping
ChattyBox admite cuatro modos de scraping. Obtiene HTML público: no ejecuta JavaScript ni aplica robots.txt; no envíe contenido privado ni espere autenticación o CAPTCHA.
1. Solo la página de inicio
Extrae solo la página de inicio de tu sitio. Ideal para páginas de destino sencillas o si quieres indexar la menor cantidad de contenido posible.
2. Modo sitemap (Recomendado)
Proporciona una sitemap para descubrir páginas del mismo origen. Los límites de páginas, filtros y presupuesto de actualización siguen aplicando; una sitemap no garantiza que se indexe toda URL.
https://example.com/sitemap.xml
3. Crawl
Primero prueba /sitemap.xml y /sitemap_index.xml; solo si no dan URL sigue enlaces del mismo origen hasta la profundidad configurada (3 por defecto). No rellena una sitemap incompleta siguiendo enlaces.
4. URLs manuales
Especifica las URL exactas que quieres extraer, una por línea. Usa esto cuando quieras tener un control preciso sobre qué páginas se indexan.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Límites de páginas
maxPages guarda la solicitud; cada ejecución limita el descubrimiento y la selección salientes a min(solicitud, max(capacidad actual de páginas del proveedor, páginas conocidas existentes del proyecto)). Con capacidad cero o denegada, solo se actualizan páginas conocidas existentes; si no hay ninguna, no hay descubrimiento saliente de páginas desconocidas. Esto no modifica los derechos del pool del propietario.
Distinga páginas almacenadas y trabajo mensual de actualización. Cambiar la fuente o bajar el límite no borra las páginas antiguas.
| Plan | Páginas incluidas |
|---|---|
| Free | 10 |
| Starter | 150 |
| Pro | 5,000 |
| Business | 25,000 |
Extracción de contenido
Free tiene un presupuesto mensual de 500 actualizaciones, Starter 5.000, Pro 100.000 y Business 250.000. Free permite refrescos semanales como máximo; los planes de pago, diarios. Un scrape manual no elude el enfriamiento ni el presupuesto; PAYG no los elimina.
Progreso y contenido parcial
Completed solo significa que el trabajo terminó: compare el recuento guardado y Content con las URL esperadas. Los embeddings cambiados se procesan en un trabajo separado. Partially indexed indica que se guardó solo el inicio de texto que excedía 512 KiB UTF-8; no es un informe completo de fallos por URL.
Extracción de contenido
ChattyBox toma el título y prefiere <main>, luego <article>, luego role="main", con fallback al cuerpo. Extrae:
- Título de la página - La etiqueta
<title> - Encabezados - Todas las etiquetas, de
<h1>a<h6> - Párrafos - Todo el contenido de
<p> - Listas - Elementos de
<ul>y<ol>
Contenido ignorado
La extracción excluye elementos comunes de navegación, pie, script/estilo, ocultos y banners de consentimiento, además de iframes, canvas, SVG y objetos. Son heurísticas de HTML, no cálculo de diseño: no asuma que todo elemento visualmente oculto será detectado.
- menús de navegación
- contenido del pie de página
- scripts y estilos
Solución de problemas
¿No se extraen las páginas?
- Comprueba que la URL sea accesible públicamente
- Comprueba solicitudes HTML públicas sin inicio de sesión, CAPTCHA ni desafío de bots;
robots.txtno se consulta - Verifica que la página no requiera autenticación
¿Falta contenido en las respuestas?
- Vuelve a extraer la página para obtener el contenido más reciente
- Sirve el texto importante en el HTML inicial: JavaScript no se renderiza
- Asegúrate de que el contenido esté en la parte principal de la página, no en iframes
¿Necesitas más control?
Para fuentes no admitidas o fallos persistentes, contacte support@chattybox.ai con una URL pública; no envíe credenciales ni espere crawling autenticado o renderizado de JavaScript.