Saltar al contenido principal

Extracción de contenido

Configura cómo ChattyBox rastrea tu sitio web e indexa el contenido para las respuestas de IA.

Para un despliegue de contenido público, consulta la guía del chatbot de IA para sitios web sobre cómo elegir documentación fiable, artículos de ayuda, páginas de productos y preguntas frecuentes antes de probar respuestas con citas.

Modos de scraping

ChattyBox admite cuatro modos de scraping. Obtiene HTML público: no ejecuta JavaScript ni aplica robots.txt; no envíe contenido privado ni espere autenticación o CAPTCHA.

1. Solo la página de inicio

Extrae solo la página de inicio de tu sitio. Ideal para páginas de destino sencillas o si quieres indexar la menor cantidad de contenido posible.

2. Modo sitemap (Recomendado)

Proporciona una sitemap para descubrir páginas del mismo origen. Los límites de páginas, filtros y presupuesto de actualización siguen aplicando; una sitemap no garantiza que se indexe toda URL.

https://example.com/sitemap.xml

3. Crawl

Primero prueba /sitemap.xml y /sitemap_index.xml; solo si no dan URL sigue enlaces del mismo origen hasta la profundidad configurada (3 por defecto). No rellena una sitemap incompleta siguiendo enlaces.

4. URLs manuales

Especifica las URL exactas que quieres extraer, una por línea. Usa esto cuando quieras tener un control preciso sobre qué páginas se indexan.

https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq

Límites de páginas

maxPages guarda la solicitud; cada ejecución limita el descubrimiento y la selección salientes a min(solicitud, max(capacidad actual de páginas del proveedor, páginas conocidas existentes del proyecto)). Con capacidad cero o denegada, solo se actualizan páginas conocidas existentes; si no hay ninguna, no hay descubrimiento saliente de páginas desconocidas. Esto no modifica los derechos del pool del propietario.

Distinga páginas almacenadas y trabajo mensual de actualización. Cambiar la fuente o bajar el límite no borra las páginas antiguas.

PlanPáginas incluidas
Free10
Starter150
Pro5,000
Business25,000

Extracción de contenido

Free tiene un presupuesto mensual de 500 actualizaciones, Starter 5.000, Pro 100.000 y Business 250.000. Free permite refrescos semanales como máximo; los planes de pago, diarios. Un scrape manual no elude el enfriamiento ni el presupuesto; PAYG no los elimina.

Progreso y contenido parcial

Completed solo significa que el trabajo terminó: compare el recuento guardado y Content con las URL esperadas. Los embeddings cambiados se procesan en un trabajo separado. Partially indexed indica que se guardó solo el inicio de texto que excedía 512 KiB UTF-8; no es un informe completo de fallos por URL.

Extracción de contenido

ChattyBox toma el título y prefiere <main>, luego <article>, luego role="main", con fallback al cuerpo. Extrae:

  • Título de la página - La etiqueta <title>
  • Encabezados - Todas las etiquetas, de <h1> a <h6>
  • Párrafos - Todo el contenido de <p>
  • Listas - Elementos de <ul> y <ol>

Contenido ignorado

La extracción excluye elementos comunes de navegación, pie, script/estilo, ocultos y banners de consentimiento, además de iframes, canvas, SVG y objetos. Son heurísticas de HTML, no cálculo de diseño: no asuma que todo elemento visualmente oculto será detectado.

  • menús de navegación
  • contenido del pie de página
  • scripts y estilos

Solución de problemas

¿No se extraen las páginas?

  • Comprueba que la URL sea accesible públicamente
  • Comprueba solicitudes HTML públicas sin inicio de sesión, CAPTCHA ni desafío de bots; robots.txt no se consulta
  • Verifica que la página no requiera autenticación

¿Falta contenido en las respuestas?

  • Vuelve a extraer la página para obtener el contenido más reciente
  • Sirve el texto importante en el HTML inicial: JavaScript no se renderiza
  • Asegúrate de que el contenido esté en la parte principal de la página, no en iframes

¿Necesitas más control?

Para fuentes no admitidas o fallos persistentes, contacte support@chattybox.ai con una URL pública; no envíe credenciales ni espere crawling autenticado o renderizado de JavaScript.

Utilizamos herramientas opcionales de analítica y gestión de etiquetas para comprender el uso del sitio. Elige si quieres permitir Ahrefs Web Analytics, PostHog y Google Tag Manager. Al desactivar la analítica, esta página se recargará para que el cambio se aplique correctamente. Las funciones esenciales del sitio y la monitorización de errores no dependen de esta opción. Lee nuestra política de privacidad.