Inhalts-Scraping
Konfigurieren Sie, wie ChattyBox Ihre Website crawlt und Inhalte für AI-Antworten indexiert.
Speichern Sie in Settings die Website URL mit Save Changes und danach Modus, Maximum Pages und Zeitplan unter Scraping Configuration mit Save Config. Dies sind getrennte Formulare. Scrape Now nutzt die aktuellen Crawling-Formularwerte und öffnet den Fortschritt. Auch manuelle URLs benötigen eine gespeicherte Website-URL.
:::warning Nur öffentliches HTML
Der Crawler ruft HTML ohne Browser ab und führt kein JavaScript aus. Er liest oder beachtet robots.txt nicht. Indexieren Sie nur autorisierte Inhalte und wählen Sie Quellen ausdrücklich aus. Authentifizierung, CAPTCHA-Lösung und private Netzwerke werden nicht unterstützt.
:::
Für einen Rollout öffentlicher Inhalte finden Sie im Leitfaden für KI-Chatbots auf Websites, wie Sie vertrauenswürdige Dokumente, Hilfeartikel, Produktseiten und FAQs auswählen, bevor Sie zitierte Antworten testen.
Scraping-Modi
ChattyBox unterstützt vier Scraping-Modi:
1. Nur die Homepage
Ruft nur die gespeicherte Website-URL ab, die auch eine einzelne Unterseite sein kann. Geeignet für eine Landingpage oder einen Test mit einer Seite.
2. Sitemap-Modus (Empfohlen)
Eine Sitemap dient zur Entdeckung von Seiten, einschließlich untergeordneter Sitemaps innerhalb eines Tiefenlimits. Nur Seiten-URLs mit demselben Ursprung wie die Website-URL bleiben erhalten. Filter, Seitenlimits und Aktualisierungsbudgets gelten weiterhin; eine Sitemap garantiert keine vollständige Indexierung.
https://example.com/sitemap.xml
Bei leerer Sitemap URL versucht ChattyBox /sitemap.xml, dann /sitemap_index.xml und schließlich nur die gespeicherte Website-URL. Eine ausdrücklich angegebene Sitemap ohne URLs lässt den Auftrag stattdessen fehlschlagen.
3. Crawl-Modus
crawl versucht zunächst die beiden üblichen Sitemaps. Liefern beide keine URLs, folgt es Same-Origin-Links ab der Startseite bis zur konfigurierten Tiefe (Standard 3). Liefert eine Sitemap URLs, werden keine Links zum Ergänzen fehlender Seiten verfolgt. Heuristiken überspringen typische Konto-, Login-, Checkout-, Such- und Ressourcen-URLs; sie sind keine Datenschutzgrenze.
4. Manuelle URLs
Geben Sie die genauen URLs zum Scrapen an, eine pro Zeile. Nutzen Sie dies, wenn Sie genau steuern möchten, welche Seiten indexiert werden.
Diese öffentlichen URLs werden nicht durch Linkverfolgung erweitert; Seiten- und Aktualisierungslimits gelten weiterhin.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Erweiterte URL-Auswahl
include/exclude und die maximale Tiefe gibt es nur in Konfiguration als Code, nicht als Dashboard-Felder. Es sind groß-/kleinschreibungssensitive URL-Teilstrings, keine Globs oder regulären Ausdrücke; Ausschlüsse gewinnen. Herausgefilterte Seiten werden bei der Linksuche nicht durchlaufen. Ein Ausschluss der Startseite kann daher die gesamte Entdeckung verhindern.
Wählen Sie benötigte öffentliche Sprachversionen ausdrücklich aus. Sitemaps und Linksuche bleiben auf demselben Ursprung; eine Sprach-Subdomain benötigt eine eigene Quellenauswahl. Die Widget-Sprache übersetzt oder indexiert keine fehlenden Quellen.
Seitenlimits
maxPages speichert die Anforderung; jeder Lauf begrenzt ausgehende Entdeckung und Auswahl auf min(Anforderung, max(aktuelle Anbieter-Seitenkapazität, bekannte vorhandene Projektseiten)). Bei null oder verweigerter Kapazität werden nur bekannte vorhandene Seiten aktualisiert; ohne solche gibt es keine ausgehende Entdeckung unbekannter Seiten. Das ändert keine Berechtigungen des Eigentümerpools.
Maximum Pages begrenzt ausgewählte URLs und Platz für neue Seiten. Bereits indexierte URLs werden bevorzugt, wenn sie erneut entdeckt werden. Ein Quellenwechsel oder kleineres Limit löscht keine alten Seiten. Gespeicherte Seiten und monatliche Aktualisierungsarbeit sind getrennte Grenzen:
| Tarif | Enthaltene Seiten | Monatliches Aktualisierungsbudget | Schnellster Rhythmus |
|---|---|---|---|
| Free | 10 | 500 | Wöchentlich |
| Starter | 150 | 5.000 | Täglich |
| Pro | 5.000 | 100.000 | Täglich |
| Business | 25.000 | 250.000 | Täglich |
Pro und Business können Seiten-PAYG in Account & Billing aktivieren. Free und Starter bleiben hart begrenzt. PAYG-Seitenkontingent erhöht das separate monatliche Aktualisierungsbudget des Crawlers nicht.
Inhalte aktualisieren
- Automatische Aktualisierung muss aktiviert werden: Free erlaubt wöchentlich oder monatlich, bezahlte Tarife zusätzlich täglich. Monatlich bedeutet alle 30 Tage, nicht an einem festen Kalendertag.
- Seit Erstellung des letzten Crawl-Auftrags müssen sieben Tage auf Free oder 24 Stunden in bezahlten Tarifen vergehen, auch nach Fehlern. Ein wartender oder laufender Auftrag blockiert weitere manuelle Crawls.
- Jede neue Seite oder Änderung des extrahierten Texts verbraucht eine Einheit. Unveränderte Seiten aktualisieren nur Metadaten, ohne neue Einheit oder inhaltsbedingten Embedding-Neuaufbau.
- Das Budget wird über die Projekte des Eigentümers beziehungsweise den früheren Workspace geteilt und am Beginn jedes UTC-Kalendermonats zurückgesetzt.
- Erfolgreicher Abruf ersetzt gespeicherten Text; Abruffehler und abgewiesene Sperr-/Fehlerseiten lassen den alten Text bestehen. Aus der Sitemap entfernte URLs bleiben im Korpus, bis Sie sie auch in Content löschen und von künftiger Entdeckung ausschließen.
Fortschritt und Teilindexierung
In Content > Scrape Jobs sehen Sie Status, Seitenzahlen, Zeitstempel und Schätzungen beim Speichern. Eine frühe Null kann laufende Entdeckung bedeuten. Zählwerte betreffen gespeicherte Seiten einschließlich unveränderter Seiten, nicht fertige Embeddings.
Completed bedeutet nur, dass der Lauf endete: Fehler, Limits oder eine leere Auswahl können weniger oder null gespeicherte Seiten ergeben. Vergleichen Sie die tatsächliche Content-Liste mit Ihren Erwartungen. Auftragsdetails zeigen höchstens 200 gespeicherte Seiten; die Inhaltsliste ist paginiert. Es gibt keinen vollständigen Fehlerbericht je URL.
Partially indexed bedeutet, dass extrahierter Text das Speicherlimit von 512 KiB UTF-8 überschritt. Nur der Anfang bleibt erhalten; die Oberfläche zeigt gespeicherte und extrahierte Bytes. Completed with warnings kennzeichnet diese Kürzung, nicht alle Crawl-Fehler. Teilen Sie lange Seiten auf. HTTP-Antworten über 5 MiB und Weiterleitungsketten mit mehr als fünf Sprüngen werden separat abgewiesen.
Geänderte Inhalte starten einen eigenen Embedding-Auftrag. Prüfen Sie Indexstatus und repräsentative Antworten vor dem Start.
Inhaltspflege
Content bietet Einzellöschung, Clear All und Rebuild Index. Löschen entfernt Text und Embeddings, nicht die Quellkonfiguration; spätere Crawls können Inhalte wieder hinzufügen. Rebuild Index nutzt gespeicherten Text ohne erneuten Website-Abruf, Wiederherstellung gelöschter Seiten oder abgeschnittener Texte. Die wöchentliche/tägliche Wartezeit läuft ab dem letzten Embedding-Auftrag; jede reservierte Seite verbraucht gemeinsames Aktualisierungsbudget. Automatische Embeddings geänderter Crawl-Seiten berechnen diese Arbeit nicht doppelt. Konfigurationsgesperrte Projekte lehnen manuelle Inhaltsoperationen ab; verwenden Sie die CLI.
Inhaltsextraktion
ChattyBox liest den Seitentitel und bevorzugt <main>, dann <article>, dann role="main", zuletzt den Body. Im ausgewählten Inhalt bleiben erhalten:
- Seitentitel - Das
<title>-Tag - Überschriften - Alle
<h1>- bis<h6>-Tags - Absätze - Alle Inhalte in
<p>-Tags - Listen -
<ul>- und<ol>-Elemente - Code und Tabellen - Text einschließlich Leerraum in vorformatiertem Code
Bei zu wenig HTML-Text kann ein begrenzter Fallback ein Same-Origin-OpenAPI-Dokument aus einer erkannten SwaggerUIBundle-Konfiguration abrufen. Das ist weder allgemeines JavaScript-Rendering noch Datei-Upload oder Unterstützung aller API-Viewer.
Ignorierte Inhalte
Die Extraktion schließt unter anderem aus:
- Navigationsmenüs
- Inhalte im Footer
- Skripte und Styles
- Elemente mit
hidden,aria-hidden="true"oder Inline-display: none/visibility: hidden - Erkannte Einwilligungsbanner und Dialog-/Navigationsrollen
- Iframes, Canvas, SVG und eingebettete Objekte
Diese HTML-Heuristiken berechnen kein Browserlayout und erkennen nicht zwingend jedes visuell versteckte Element oder Banner.
Fehlerbehebung
Seiten werden nicht gescraped?
- Prüfen Sie, ob die URL öffentlich zugänglich ist
- Prüfen Sie, ob gewöhnliche HTML-Anfragen ohne CAPTCHA oder Bot-Challenge erlaubt sind;
robots.txtwird nicht ausgewertet - Prüfen Sie, ob die Seite nicht durch eine Anmeldung geschützt ist
- Prüfen Sie Modus, Ursprung, Auswahl, Budgets und Linktiefe
Fehlt Inhalt in den Antworten?
- Crawlen Sie nach Veröffentlichung und Ablauf der Wartezeit erneut und warten Sie auf Embeddings
- Stellen Sie wichtigen Text im ursprünglichen HTML bereit; reine JavaScript-Inhalte werden nicht gerendert
- Stellen Sie sicher, dass sich die Inhalte im Hauptinhalt befinden, nicht in iframes
- Prüfen Sie Warnungen zur Teilindexierung
Mehr Kontrolle gewünscht?
Kontaktieren Sie bei nicht unterstützten Quellen oder Extraktionsfehlern support@chattybox.ai mit einer öffentlichen Beispiel-URL. Senden Sie keine Zugangsdaten und gehen Sie nicht davon aus, dass der Support authentifiziertes Crawling oder JavaScript-Rendering aktivieren kann. Nutzen Sie auch die Startcheckliste und Fehlerbehebung.