Hoppa till huvudinnehållet

Innehållsskrapning

Konfigurera hur ChattyBox genomsöker din webbplats och indexerar innehåll för AI-genererade svar.

För en lansering med offentligt innehåll kan du läsa guiden för AI-chattbotar för webbplatser om hur du väljer tillförlitlig dokumentation, hjälpartiklar, produktsidor och vanliga frågor innan du testar citerade svar.

Skrapningslägen

ChattyBox har stöd för fyra skrapningslägen. Crawlern hämtar offentlig HTML, kör inte JavaScript och läser eller tillämpar inte robots.txt. Skicka bara innehåll som du har rätt att indexera; inloggning, CAPTCHA och privata nätverk stöds inte.

1. Endast startsidan

Skrapar bara din startsida. Bäst för enkla landningssidor eller när du vill få så lite innehåll som möjligt indexerat.

2. Webbplatskarteläge (rekommenderas)

Ange en URL till webbplatskartan för att upptäcka sidor på samma origin, även i underliggande webbplatskartor. En webbplatskarta är en upptäcktskälla, inte en garanti för att varje URL indexeras: filter, sidgränser och uppdateringsbudget gäller fortfarande. Om Sitemap URL lämnas tom provas /sitemap.xml och sedan /sitemap_index.xml; om ingen ger URL:er används bara sparad Website URL. En uttryckligen angiven tom sitemap gör däremot att jobbet misslyckas.

https://example.com/sitemap.xml

3. Crawl-läge

Starta från en offentlig URL. Crawlern provar först /sitemap.xml och /sitemap_index.xml; om de inte ger URL:er följer den länkar på samma origin upp till valt djup (standard 3). En ofullständig hittad sitemap kompletteras inte med länkar.

4. Manuella URL:er

Ange de exakta publika URL:er som ska skrapas, en per rad. Använd det här när du vill ha exakt kontroll över vilka sidor som indexeras. URL:erna utökas inte genom länkföljning och sid- samt uppdateringsgränser gäller fortfarande.

https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq

Sidgränser

maxPages lagrar begäran; varje körning begränsar utgående upptäckt och urval till min(begäran, max(leverantörens aktuella sidkapacitet, kända befintliga projektsidor)). Vid noll eller nekad kapacitet kan bara kända befintliga sidor uppdateras; utan sådana sker ingen utgående upptäckt av okända sidor. Detta ändrar inte ägarpoolens behörigheter.

Skilj på lagrade sidor och månatligt uppdateringsarbete. Maximum Pages begränsar ett körningsurval; den raderar inte automatiskt äldre indexerade URL:er.

AbonnemangInkluderade sidorMånatlig uppdateringsbudget
Free10500
Starter1505 000
Pro5 000100 000
Business25 000250 000

Tabellen anger publicerade nivåer men inte ett gemensamt kontoskop för varje gräns. Kontrollera plan- och kontovyn för den aktuella tillämpningen. Free kan starta en ny skrapning tidigast efter sju dagar, betalda planer efter 24 timmar, även efter ett misslyckat jobb. Uppdateringsbudgeten delas mellan ägarens projekt och återställs varje UTC-månad. En borttagen sitemap-URL kan ligga kvar i kunskapsbasen tills den tas bort i Content.

Status och partiell indexering

Completed betyder att körningen avslutades, inte att varje URL lyckades. Jämför sparade sidor med förväntade URL:er och invänta det separata embedding-jobbet. Partially indexed betyder att extraherad text översteg 512 KiB UTF-8: endast början behålls. Fetch-svar över 5 MiB eller fler än fem omdirigeringar avvisas separat.


Innehållsextrahering

ChattyBox extraherar:

  • Sidtitel - Taggen <title>
  • Huvudinnehåll - Text från <main>, <article> eller <body>
  • Rubriker - Alla taggar från <h1> till <h6>
  • Stycken - Allt innehåll i <p>
  • Listor - Listobjekt i <ul> och <ol>

Ignorerat innehåll

ChattyBox ignorerar automatiskt:

  • Navigeringsmenyer
  • Innehåll i sidfoten
  • Skript och stilmallar
  • Dolda element
  • Cookiebanners

Felsökning

Skrapas inga sidor?

  • Kontrollera att URL:en är offentligt tillgänglig
  • Kontrollera läge, origin, valda URL:er, sidutrymme och uppdateringsbudget; robots.txt läses eller tillämpas inte
  • Kontrollera att sidan inte ligger bakom inloggning

Saknas innehåll i svaren?

  • Skrapa sidan på nytt för att hämta det senaste innehållet
  • Servera viktigt innehåll i den första HTML:en; JavaScript-only innehåll renderas inte
  • Se till att innehållet finns i sidans huvudinnehåll, inte i iframes

Behöver du mer kontroll?

För uthålliga extraheringsproblem kan du kontakta support@chattybox.ai med en offentlig exempel-URL. Skicka inte inloggningsuppgifter och förutsätt inte stöd för autentiserad eller JavaScript-renderad crawling.

Vi använder valfria analys- och tagghanteringsverktyg för att förstå hur webbplatsen används. Välj om du vill tillåta Ahrefs Web Analytics, PostHog och Google Tag Manager. Om du stänger av analysen laddas sidan om så att ändringen genomförs korrekt. Grundläggande webbplatsfunktioner och felövervakning styrs inte av detta val. Läs vår integritetspolicy.