Innehållsskrapning
Konfigurera hur ChattyBox genomsöker din webbplats och indexerar innehåll för AI-genererade svar.
För en lansering med offentligt innehåll kan du läsa guiden för AI-chattbotar för webbplatser om hur du väljer tillförlitlig dokumentation, hjälpartiklar, produktsidor och vanliga frågor innan du testar citerade svar.
Skrapningslägen
ChattyBox har stöd för fyra skrapningslägen. Crawlern hämtar offentlig HTML, kör inte JavaScript och läser eller tillämpar inte robots.txt. Skicka bara innehåll som du har rätt att indexera; inloggning, CAPTCHA och privata nätverk stöds inte.
1. Endast startsidan
Skrapar bara din startsida. Bäst för enkla landningssidor eller när du vill få så lite innehåll som möjligt indexerat.
2. Webbplatskarteläge (rekommenderas)
Ange en URL till webbplatskartan för att upptäcka sidor på samma origin, även i underliggande webbplatskartor. En webbplatskarta är en upptäcktskälla, inte en garanti för att varje URL indexeras: filter, sidgränser och uppdateringsbudget gäller fortfarande. Om Sitemap URL lämnas tom provas /sitemap.xml och sedan /sitemap_index.xml; om ingen ger URL:er används bara sparad Website URL. En uttryckligen angiven tom sitemap gör däremot att jobbet misslyckas.
https://example.com/sitemap.xml
3. Crawl-läge
Starta från en offentlig URL. Crawlern provar först /sitemap.xml och /sitemap_index.xml; om de inte ger URL:er följer den länkar på samma origin upp till valt djup (standard 3). En ofullständig hittad sitemap kompletteras inte med länkar.
4. Manuella URL:er
Ange de exakta publika URL:er som ska skrapas, en per rad. Använd det här när du vill ha exakt kontroll över vilka sidor som indexeras. URL:erna utökas inte genom länkföljning och sid- samt uppdateringsgränser gäller fortfarande.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Sidgränser
maxPages lagrar begäran; varje körning begränsar utgående upptäckt och urval till min(begäran, max(leverantörens aktuella sidkapacitet, kända befintliga projektsidor)). Vid noll eller nekad kapacitet kan bara kända befintliga sidor uppdateras; utan sådana sker ingen utgående upptäckt av okända sidor. Detta ändrar inte ägarpoolens behörigheter.
Skilj på lagrade sidor och månatligt uppdateringsarbete. Maximum Pages begränsar ett körningsurval; den raderar inte automatiskt äldre indexerade URL:er.
| Abonnemang | Inkluderade sidor | Månatlig uppdateringsbudget |
|---|---|---|
| Free | 10 | 500 |
| Starter | 150 | 5 000 |
| Pro | 5 000 | 100 000 |
| Business | 25 000 | 250 000 |
Tabellen anger publicerade nivåer men inte ett gemensamt kontoskop för varje gräns. Kontrollera plan- och kontovyn för den aktuella tillämpningen. Free kan starta en ny skrapning tidigast efter sju dagar, betalda planer efter 24 timmar, även efter ett misslyckat jobb. Uppdateringsbudgeten delas mellan ägarens projekt och återställs varje UTC-månad. En borttagen sitemap-URL kan ligga kvar i kunskapsbasen tills den tas bort i Content.
Status och partiell indexering
Completed betyder att körningen avslutades, inte att varje URL lyckades. Jämför sparade sidor med förväntade URL:er och invänta det separata embedding-jobbet. Partially indexed betyder att extraherad text översteg 512 KiB UTF-8: endast början behålls. Fetch-svar över 5 MiB eller fler än fem omdirigeringar avvisas separat.
Innehållsextrahering
ChattyBox extraherar:
- Sidtitel - Taggen
<title> - Huvudinnehåll - Text från
<main>,<article>eller<body> - Rubriker - Alla taggar från
<h1>till<h6> - Stycken - Allt innehåll i
<p> - Listor - Listobjekt i
<ul>och<ol>
Ignorerat innehåll
ChattyBox ignorerar automatiskt:
- Navigeringsmenyer
- Innehåll i sidfoten
- Skript och stilmallar
- Dolda element
- Cookiebanners
Felsökning
Skrapas inga sidor?
- Kontrollera att URL:en är offentligt tillgänglig
- Kontrollera läge, origin, valda URL:er, sidutrymme och uppdateringsbudget;
robots.txtläses eller tillämpas inte - Kontrollera att sidan inte ligger bakom inloggning
Saknas innehåll i svaren?
- Skrapa sidan på nytt för att hämta det senaste innehållet
- Servera viktigt innehåll i den första HTML:en; JavaScript-only innehåll renderas inte
- Se till att innehållet finns i sidans huvudinnehåll, inte i iframes
Behöver du mer kontroll?
För uthålliga extraheringsproblem kan du kontakta support@chattybox.ai med en offentlig exempel-URL. Skicka inte inloggningsuppgifter och förutsätt inte stöd för autentiserad eller JavaScript-renderad crawling.