Ga naar de hoofdinhoud

Inhoud scrapen

Stel in hoe ChattyBox je website doorzoekt en inhoud indexeert voor AI-antwoorden.

Sla in Settings de Website URL op met Save Changes en daarna de modus, Maximum Pages en planning in Scraping Configuration met Save Config. Dit zijn aparte formulieren. Scrape Now gebruikt de huidige scrapeformulierwaarden en opent de voortgang. Ook bij handmatige URL’s is een opgeslagen website-URL vereist.

:::warning Alleen openbare HTML De crawler haalt HTML op zonder browser en voert geen JavaScript uit. Hij leest of handhaaft robots.txt niet. Indexeer alleen toegestane inhoud en selecteer bronnen expliciet. Authenticatie, CAPTCHA-oplossing en privénetwerken worden niet ondersteund. :::

Bekijk voor een uitrol van openbare inhoud de gids voor AI-chatbots voor websites om te bepalen hoe u betrouwbare documentatie, Help-artikelen, productpagina’s en veelgestelde vragen kiest voordat u antwoorden met bronvermeldingen test.

Scrapingmodi

ChattyBox ondersteunt vier scrapingmodi:

1. Alleen de homepage

Scrapet alleen de opgeslagen website-URL, die ook een specifieke subpagina kan zijn. Geschikt voor een landingspagina of een evaluatie met één pagina.

2. Sitemapmodus (Aanbevolen)

Een sitemap ontdekt pagina’s, inclusief onderliggende sitemaps binnen een dieptelimiet. Alleen pagina-URL’s van dezelfde origin als de website-URL blijven over. Filters, paginalimieten en verversingsbudgetten blijven gelden; een sitemap garandeert geen volledige indexering.

https://example.com/sitemap.xml

Bij een lege Sitemap URL probeert ChattyBox /sitemap.xml, dan /sitemap_index.xml en ten slotte alleen de opgeslagen website-URL. Een expliciet opgegeven sitemap zonder URL’s laat de taak juist mislukken, zonder terugval.

3. Crawlmodus

crawl probeert eerst de twee gebruikelijke sitemaps. Leveren die geen URL’s op, dan volgt hij links van dezelfde origin vanaf de startpagina tot de ingestelde diepte (standaard 3). Levert een sitemap URL’s op, dan worden geen links gevolgd om ontbrekende pagina’s aan te vullen. Heuristieken slaan gangbare account-, login-, checkout-, zoek- en resource-URL’s over; dit vormt geen privacygrens.

4. Handmatige URL's

Geef de exacte URL's op om te scrapen, één per regel. Gebruik dit als je precies wilt bepalen welke pagina's worden geïndexeerd.

Deze openbare URL’s worden niet uitgebreid door links te volgen; pagina- en verversingslimieten blijven gelden.

https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq

Geavanceerde URL-selectie

include/exclude en maximale diepte zijn alleen beschikbaar via configuratie als code, niet als dashboardvelden. Het zijn hoofdlettergevoelige URL-substrings, geen globs of reguliere expressies; uitsluiting gaat voor. Uitgefilterde pagina’s worden bij linkontdekking niet doorlopen, dus de startpagina uitsluiten kan alle ontdekking verhinderen.

Selecteer expliciet de benodigde openbare taalversies. Sitemaps en linkontdekking blijven op dezelfde origin; een taal op een subdomein vereist eigen bronselectie. Een widgettaal vertaalt of indexeert geen ontbrekende bronnen.

Paginalimieten

maxPages slaat de aanvraag op; elke uitvoering beperkt uitgaande ontdekking en selectie tot min(aanvraag, max(huidige paginacapaciteit van de provider, bekende bestaande projectpagina's)). Bij nul of geweigerde capaciteit kunnen alleen bekende bestaande pagina's worden vernieuwd; zonder zulke pagina's vindt geen uitgaande ontdekking van onbekende pagina's plaats. Dit wijzigt geen rechten van de eigenarenpool.

Maximum Pages begrenst geselecteerde URL’s en ruimte voor nieuwe pagina’s. Bestaande geïndexeerde URL’s krijgen voorrang als ze opnieuw worden gevonden. Een andere bron of lagere limiet verwijdert geen oude pagina’s. Opgeslagen pagina’s en maandelijks verversingswerk zijn afzonderlijke grenzen:

AbonnementInbegrepen pagina’sMaandelijks verversingsbudgetSnelste frequentie
Free10500Wekelijks
Starter1505.000Dagelijks
Pro5.000100.000Dagelijks
Business25.000250.000Dagelijks

Pro en Business kunnen pagina-PAYG inschakelen in Account & Billing. Free en Starter blijven hard begrensd. Het PAYG-paginaquotum verhoogt het afzonderlijke maandelijkse verversingsbudget van de crawler niet.

Inhoud verversen

  • Automatische verversing moet worden ingeschakeld: Free ondersteunt wekelijks of maandelijks, betaalde abonnementen ook dagelijks. Maandelijks betekent elke 30 dagen, niet een vaste kalenderdatum.
  • Sinds het aanmaken van de laatste scrapetaak moeten zeven dagen op Free of 24 uur op betaalde abonnementen zijn verstreken, ook na fouten. Een wachtende of lopende taak blokkeert een nieuwe handmatige scrape.
  • Elke nieuwe pagina of wijziging in geëxtraheerde tekst verbruikt één eenheid. Ongewijzigde pagina’s werken alleen metadata bij, zonder extra eenheid of inhoudsgerelateerde herbouw van embeddings.
  • Het budget wordt gedeeld tussen projecten van de eigenaar of de oude werkruimte en wordt aan het begin van elke UTC-kalendermaand gereset.
  • Succesvol ophalen vervangt opgeslagen tekst; mislukte verzoeken en afgewezen blokkeer-/foutpagina’s laten oude inhoud staan. Een URL uit de sitemap verwijderen verwijdert die niet uit het corpus: verwijder hem ook in Content en uit toekomstige ontdekking.

Voortgang en gedeeltelijke indexering

In Content > Scrape Jobs staan status, aantallen, tijdstippen en schattingen tijdens het opslaan. Een vroege nul kan lopende ontdekking betekenen. Aantallen gaan over opgeslagen pagina’s, ook ongewijzigde, niet over voltooide embeddings.

Completed betekent alleen dat de taak eindigde: fouten, limieten of een lege selectie kunnen minder of nul pagina’s opleveren. Vergelijk de werkelijke Content-lijst met de verwachte URL’s. Taakdetails tonen maximaal 200 opgeslagen pagina’s; de inhoudslijst is gepagineerd. Er is geen volledig foutenrapport per URL.

Partially indexed betekent dat geëxtraheerde tekst de opslaglimiet van 512 KiB UTF-8 overschreed. Alleen het begin blijft bewaard; de interface toont opgeslagen tegenover geëxtraheerde bytes. Completed with warnings duidt op deze afkapping, niet op alle crawlfouten. Splits lange pagina’s. HTTP-antwoorden groter dan 5 MiB en ketens van meer dan vijf omleidingen worden afzonderlijk geweigerd.

Gewijzigde inhoud start een aparte embeddingtaak. Controleer indexstatus en representatieve antwoorden vóór de lancering.

Inhoud onderhouden

Content biedt verwijderen per pagina, Clear All en Rebuild Index. Verwijderen wist tekst en embeddings, niet de bronconfiguratie; latere scrapes kunnen ze terugplaatsen. Rebuild Index gebruikt opgeslagen tekst zonder de site opnieuw op te halen, verwijderde pagina’s te herstellen of afgekapte tekst terug te halen. De wekelijkse/dagelijkse wachttijd loopt vanaf de laatste embeddingtaak; elke gereserveerde pagina verbruikt gedeeld verversingsbudget. Automatische embeddings voor gewijzigde gescrapete pagina’s belasten dit werk niet dubbel. Configuratievergrendelde projecten weigeren deze handmatige bewerkingen; gebruik de CLI.


Inhoudsextractie

ChattyBox leest de paginatitel en kiest eerst <main>, dan <article>, dan role="main" en anders de body. Binnen die inhoud bewaart het:

  • Paginatitel - De <title>-tag
  • Koppen - Alle <h1>- tot en met <h6>-tags
  • Alinea's - Alle inhoud in <p>-tags
  • Lijsten - Items in <ul>- en <ol>-tags
  • Code en tabellen - Tekst, met behoud van witruimte in voorgeformatteerde code

Bij te weinig HTML-tekst kan een beperkte terugval een OpenAPI-document van dezelfde origin ophalen uit een herkende SwaggerUIBundle-configuratie. Dit is geen algemene JavaScript-rendering, bestandsupload of ondersteuning voor elke API-viewer.

Genegeerde inhoud

De extractie sluit onder meer uit:

  • Navigatiemenu's
  • Inhoud in de voettekst
  • Scripts en stijlen
  • Elementen met hidden, aria-hidden="true" of inline display: none / visibility: hidden
  • Herkende toestemmingsbanners en dialoog-/navigatierollen
  • Iframes, canvas, SVG en ingebedde objecten

Deze HTML-heuristieken berekenen geen browserlay-out en herkennen niet noodzakelijk elk visueel verborgen element of elke banner.


Problemen oplossen

Worden pagina's niet gescrapet?

  • Controleer of de URL openbaar toegankelijk is
  • Controleer of gewone HTML-verzoeken zonder CAPTCHA of botcontrole toegestaan zijn; robots.txt wordt niet geraadpleegd
  • Controleer of de pagina niet is afgeschermd met een inlog
  • Controleer modus, origin, selectie, budgetten en linkdiepte

Ontbreekt er inhoud in antwoorden?

  • Scrape opnieuw na publicatie en na de wachttijd, en wacht daarna op embeddings
  • Bied belangrijke tekst in de oorspronkelijke HTML aan; inhoud die alleen via JavaScript laadt wordt niet gerenderd
  • Zorg ervoor dat de inhoud in het hoofdgedeelte staat, niet in iframes
  • Controleer waarschuwingen voor gedeeltelijke indexering

Meer controle nodig?

Neem bij niet-ondersteunde bronnen of extractiefouten contact op met support@chattybox.ai met een openbare voorbeeld-URL. Stuur geen inloggegevens en neem niet aan dat support geauthenticeerd crawlen of JavaScript-rendering kan inschakelen. Bekijk ook de lanceringschecklist en probleemoplossing.

We gebruiken optionele analysetools en tools voor tagbeheer om te begrijpen hoe de site wordt gebruikt. Kies of je Ahrefs Web Analytics, PostHog en Google Tag Manager wilt toestaan. Als je analytics uitschakelt, wordt deze pagina opnieuw geladen zodat de wijziging netjes van kracht wordt. Essentiële sitefunctionaliteit en foutmonitoring vallen niet onder deze keuze. Lees ons privacybeleid.