Estrazione dei contenuti
Configura il modo in cui ChattyBox esegue la scansione del tuo sito web e indicizza i contenuti per le risposte dell'AI.
Per un rollout di contenuti pubblici, consulta la guida al chatbot AI per siti web per sapere come scegliere documenti affidabili, articoli di assistenza, pagine prodotto e domande frequenti prima di testare risposte con citazioni.
Modalità di scraping
ChattyBox supporta quattro modalità: homepage, sitemap, crawl e URL manuali. Recupera HTML pubblico, non esegue JavaScript né applica robots.txt; non supporta login, CAPTCHA o contenuti privati.
1. Solo la homepage
Estrae solo la tua homepage. Ideale per landing page semplici o quando vuoi indicizzare il minimo indispensabile di contenuti.
2. Modalità sitemap (consigliata)
Inserisci l'URL della mappa del sito e ChattyBox estrarrà tutte le pagine elencate. Questo è il modo più affidabile per garantire che tutte le tue pagine siano indicizzate.
https://example.com/sitemap.xml
3. Crawl
Prova prima /sitemap.xml e /sitemap_index.xml; solo se non producono URL segue link dello stesso origin fino alla profondità configurata. Non completa una sitemap incompleta con i link.
4. URL manuali
Specifica gli URL esatti da estrarre, uno per riga. Usa questa opzione quando vuoi avere un controllo preciso su quali pagine vengono indicizzate.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Limiti di pagine
maxPages memorizza la richiesta; ogni esecuzione limita discovery e selezione in uscita a min(richiesta, max(capacità di pagine attuale del provider, pagine esistenti note del progetto)). Con capacità zero o negata si aggiornano solo pagine esistenti note; senza di esse non avviene discovery in uscita di pagine sconosciute. Questo non modifica le entitlement del pool del proprietario.
Il numero di pagine che puoi estrarre dipende dal tuo piano:
| Piano | Pagine incluse |
|---|---|
| Free | 10 |
| Starter | 150 |
| Pro | 5,000 |
| Business | 25,000 |
Estrazione del contenuto
ChattyBox estrae:
- Titolo della pagina - Il tag
<title> - Contenuto principale - Testo da
<main>,<article>o<body> - Intestazioni - Tutti i tag da
<h1>a<h6> - Paragrafi - Testo dei tag
<p> - Elenchi - Elementi di
<ul>e<ol>
Contenuti ignorati
ChattyBox ignora automaticamente:
- Menu di navigazione
- Contenuti del piè di pagina
- Script e stili
- Elementi nascosti
- Banner dei cookie
Risoluzione dei problemi
Le pagine non vengono estratte?
- Controlla che l'URL sia accessibile pubblicamente
- Controlla richieste HTML pubbliche senza login, CAPTCHA o bot challenge;
robots.txtnon viene consultato - Verifica che la pagina non richieda autenticazione
Contenuto mancante nelle risposte?
- Estrai di nuovo la pagina per ottenere il contenuto più recente
- Il testo importante deve essere nell’HTML iniziale: JavaScript non viene renderizzato
- Assicurati che il contenuto sia nel corpo principale della pagina, non negli iframe
Hai bisogno di un maggiore controllo?
Per esigenze avanzate di estrazione (autenticazione, contenuti dinamici, ecc.), contattaci all'indirizzo support@chattybox.ai.