Extraction de contenu
Configurez la manière dont ChattyBox explore votre site web et indexe son contenu pour les réponses de l’IA.
Dans Settings, enregistrez Website URL avec Save Changes, puis le mode, Maximum Pages et la planification dans Scraping Configuration avec Save Config. Ces formulaires sont distincts. Scrape Now utilise les valeurs du formulaire d’exploration et ouvre le suivi de la tâche ; une URL de site enregistrée reste obligatoire même en mode manuel.
:::warning HTML public uniquement
Le robot récupère le HTML sans navigateur et n’exécute pas JavaScript. Il ne lit ni n’applique robots.txt. N’indexez que du contenu autorisé et sélectionnez explicitement vos sources. Authentification, résolution de CAPTCHA et réseaux privés ne sont pas pris en charge.
:::
Pour un déploiement de contenu public, consultez le guide du chatbot IA pour site web pour savoir comment choisir des documents fiables, des articles d’aide, des pages produits et des FAQ avant de tester des réponses citées.
Modes d’exploration
ChattyBox prend en charge quatre modes d’exploration :
1. Page d’accueil uniquement
Extrait uniquement l’URL de site enregistrée, qui peut désigner une page précise plutôt que la racine. Idéal pour une page de présentation ou une évaluation sur une seule page.
2. Mode Sitemap (recommandé)
Fournissez un sitemap pour découvrir les pages, y compris ses sitemaps enfants dans la limite de profondeur. Seules les URL de pages de même origine que l’URL du site sont retenues. Filtres, limites de pages et budgets s’appliquent : le sitemap ne garantit pas une indexation complète.
https://example.com/sitemap.xml
Si Sitemap URL est vide, ChattyBox essaie /sitemap.xml, puis /sitemap_index.xml, puis uniquement l’URL du site si aucun ne fournit d’URL. Un sitemap explicite sans URL fait échouer la tâche, sans repli.
3. Mode Crawl
Le mode crawl essaie d’abord les deux sitemaps conventionnels. Sans URL trouvée, il suit les liens de même origine depuis la page de départ jusqu’à la profondeur configurée (par défaut 3). Un sitemap qui fournit des URL est utilisé seul : les liens ne complètent pas un sitemap incomplet. Les exclusions heuristiques de comptes, connexion, paiement, recherche et ressources ne constituent pas une protection de confidentialité.
4. URL manuelles
Spécifiez les URL exactes à extraire, une par ligne. Utilisez cette option lorsque vous voulez contrôler précisément les pages à indexer.
Ces URL publiques ne sont pas étendues en suivant leurs liens ; les limites de pages et d’actualisation restent applicables.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Sélection avancée
Les règles include/exclude et la profondeur ne sont disponibles que par configuration en code, pas dans le tableau de bord. Ce sont des sous-chaînes d’URL sensibles à la casse, ni des globs ni des expressions régulières ; une exclusion l’emporte. Une page exclue n’est pas traversée lors de la découverte par liens : exclure la page initiale peut empêcher toute découverte.
Sélectionnez chaque version linguistique publique nécessaire. Sitemaps et liens restent sur la même origine ; une langue sur un sous-domaine nécessite une sélection distincte. La langue du widget ne traduit ni n’indexe les sources manquantes.
Limites de pages
maxPages enregistre la demande ; chaque exécution limite la découverte et la sélection sortantes à min(demande, max(capacité actuelle du fournisseur, pages existantes connues du projet)). À capacité nulle ou refusée, seules les pages existantes connues peuvent être actualisées ; sans elles, aucune page inconnue n’est découverte. Cela ne modifie pas les droits du pool du propriétaire.
Maximum Pages limite la sélection d’une tâche et la place pour les nouvelles pages. Les URL déjà indexées sont prioritaires si elles sont redécouvertes. Changer de source ou réduire la limite ne supprime pas les anciennes pages. Distinguez pages stockées et travail mensuel d’actualisation :
| Forfait | Pages incluses | Budget mensuel d’actualisation | Fréquence maximale |
|---|---|---|---|
| Free | 10 | 500 | Hebdomadaire |
| Starter | 150 | 5 000 | Quotidienne |
| Pro | 5 000 | 100 000 | Quotidienne |
| Business | 25 000 | 250 000 | Quotidienne |
Pro et Business peuvent activer les dépassements de pages PAYG dans Account & Billing. Free et Starter restent plafonnés. Le quota PAYG de pages n’augmente pas le budget mensuel distinct d’actualisation du robot.
Actualisation du contenu
- L’actualisation automatique est facultative : hebdomadaire ou mensuelle sur Free, quotidienne également sur les offres payantes. « Mensuelle » signifie tous les 30 jours, pas à une date du calendrier.
- Le délai après la création de la dernière tâche est de sept jours sur Free, 24 heures sur les offres payantes, même après un échec. Une tâche en attente ou en cours bloque aussi une nouvelle exploration manuelle.
- Chaque page nouvelle ou dont le texte extrait change consomme une unité. Les pages inchangées ne consomment pas d’unité et ne déclenchent pas de reconstruction liée à un changement.
- Le budget est partagé entre les projets du propriétaire (ou l’ancien espace de travail) et revient à zéro au début de chaque mois civil UTC.
- Une récupération réussie remplace le texte stocké ; un échec ou une page d’erreur rejetée conserve l’ancien contenu. Retirer une URL du sitemap ne la supprime pas du corpus : supprimez-la aussi dans Content et de la découverte future.
Progression et indexation partielle
Dans Content > Scrape Jobs, examinez l’état, les nombres de pages, les dates et les estimations pendant l’enregistrement. Un zéro initial peut correspondre à la découverte en cours. Les nombres concernent les pages enregistrées, même inchangées, pas les embeddings terminés.
Completed signifie que la tâche est terminée, sans garantir toutes les URL : erreurs, limites ou sélection vide peuvent produire moins de pages, voire zéro. Comparez les résultats à Content. Le détail affiche au plus 200 pages enregistrées ; la liste Content est paginée. Ce n’est pas un rapport exhaustif des échecs par URL.
Partially indexed indique un texte extrait supérieur à 512 KiB UTF-8 : seul le début est conservé et l’interface compare octets conservés et extraits. Completed with warnings signale cette troncature, pas tous les échecs d’exploration. Découpez les longues pages. Les réponses HTTP de plus de 5 MiB et les chaînes de plus de cinq redirections sont refusées séparément.
Les changements déclenchent une tâche d’embeddings distincte. Vérifiez l’état de l’index et des réponses représentatives avant le lancement.
Entretien du contenu
Content permet de supprimer une page, Clear All et Rebuild Index. Supprimer le contenu retire texte et embeddings, pas la configuration : une exploration ultérieure peut les recréer. Rebuild Index utilise le texte déjà stocké sans récupérer le site, restaurer les pages supprimées ni récupérer le texte tronqué. Son délai hebdomadaire/quotidien part de la dernière tâche d’embeddings ; chaque page réservée consomme le budget partagé. Les embeddings automatiques des pages modifiées ne sont pas facturés une seconde fois sur ce budget. Un projet verrouillé refuse ces opérations manuelles ; utilisez la CLI.
Extraction du contenu
ChattyBox lit le titre puis privilégie <main>, <article>, un élément role="main", enfin le corps de page. Dans cette zone il conserve :
- Titre de la page - La balise
<title> - Titres - Toutes les balises
<h1>à<h6> - Paragraphes - Tout le contenu des balises
<p> - Listes - Les éléments de
<ul>et<ol> - Code et tableaux - Le texte, en conservant les espaces du code préformaté
Si le HTML contient trop peu de texte, un repli limité peut récupérer un document OpenAPI de même origine référencé par une configuration SwaggerUIBundle reconnue. Ce n’est ni du rendu JavaScript général, ni de l’import de fichiers, ni une prise en charge de toutes les visionneuses API.
Contenu ignoré
L’extraction exclut notamment :
- Menus de navigation
- Contenu du pied de page
- Scripts et styles
- Éléments marqués
hidden,aria-hidden="true"ou avecdisplay: none/visibility: hiddenen ligne - Bannières de consentement reconnues et rôles de dialogue/navigation
- Iframes, canvas, SVG et objets intégrés
Ces heuristiques HTML ne calculent pas la mise en page du navigateur : tous les éléments visuellement masqués et toutes les bannières ne sont pas nécessairement détectés.
Dépannage
Les pages ne sont pas extraites ?
- Vérifiez que l’URL est accessible au public
- Vérifiez que le serveur accepte les requêtes HTML ordinaires sans CAPTCHA ni défi antibot ; les règles
robots.txtne sont pas consultées - Vérifiez que la page ne nécessite pas d’authentification
- Vérifiez le mode, l’origine, la sélection, les budgets et la profondeur des liens
Du contenu manque dans les réponses ?
- Ré-extrayez la page après publication dès que le délai le permet, puis attendez les embeddings
- Servez le texte important dans le HTML initial : le contenu uniquement chargé par JavaScript n’est pas rendu
- Assurez-vous que le contenu se trouve dans le corps principal de la page, et non dans des iframes
- Vérifiez les avertissements d’indexation partielle
Besoin de plus de contrôle ?
Pour une source non prise en charge ou une extraction défaillante, contactez support@chattybox.ai avec une URL publique d’exemple. N’envoyez pas d’identifiants et ne supposez pas que l’assistance peut activer un robot authentifié ou le rendu JavaScript. Consultez aussi la checklist de lancement et le dépannage.