Extrakce obsahu
Nastavte, jak ChattyBox prochází váš web a indexuje obsah pro odpovědi AI.
Při zavádění veřejného obsahu si přečtěte průvodce chatbotem AI pro weby, kde se dozvíte, jak před testováním citovaných odpovědí vybrat důvěryhodnou dokumentaci, články nápovědy, produktové stránky a časté dotazy.
Režimy scrapování
ChattyBox nabízí čtyři režimy scrapování. Stahuje pouze veřejné HTML: JavaScript nevykresluje a robots.txt nečte ani nevynucuje.
1. Pouze domovská stránka
Extrahuje pouze vaši domovskou stránku. Ideální pro jednoduché vstupní stránky nebo když chcete indexovat jen minimum obsahu.
2. Režim mapy webu (doporučeno)
Zadejte URL mapy webu pro nalezení stránek stejného originu. Filtry, limit stránek a rozpočet obnovování stále platí; sitemap nezaručuje indexaci každé položky.
https://example.com/sitemap.xml
3. Režim procházení
Nejprve zkusí /sitemap.xml a /sitemap_index.xml; pouze pokud nevrátí URL, sleduje odkazy stejného originu do výchozí hloubky 3. Neúplnou sitemapu odkazy nedoplňuje.
4. Ruční URL
Zadejte přesné URL k extrahování, jednu na řádek. Použijte toto, když chcete mít přesnou kontrolu nad tím, které stránky se indexují.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Limity stránek
maxPages ukládá požadavek; každý běh omezuje odchozí objevování a výběr na min(požadavek, max(aktuální kapacita poskytovatele, známé existující stránky projektu)). Při nulové či odepřené kapacitě se obnovují jen známé existující stránky; žádné znamená žádné odchozí objevování neznámých stránek. To nemění entitlementy poolu vlastníka.
Limit uložených stránek se liší od měsíčního rozpočtu obnovování; odstranění URL ze zdroje nesmaže již uloženou stránku.
| Tarif | Zahrnuté stránky |
|---|---|
| Free | 10 |
| Starter | 150 |
| Pro | 5,000 |
| Business | 25 000 |
Měsíční rozpočet obnovování je Free 500, Starter 5 000, Pro 100 000 a Business 250 000 stránek. Free lze obnovit nejdříve týdně, placené tarify po 24 hodinách; změněné/nové stránky rozpočet spotřebují a PAYG tyto limity neruší.
Průběh a částečná indexace
Completed znamená ukončenou úlohu, ne úplné pokrytí. Porovnejte uložený počet se seznamem Content a před testem počkejte na samostatnou úlohu embeddingů. Text nad 512 KiB na stránku se uloží jen částečně (Partially indexed / Completed with warnings). Rebuild Index používá uložený text, nic z webu nestahuje a také podléhá cooldownu a rozpočtu.
Extrakce obsahu
ChattyBox upřednostňuje text z <main>, poté <article> nebo role="main" a nakonec body:
- Název stránky - Tag
<title> - Nadpisy - Všechny tagy od
<h1>do<h6> - Odstavce - Veškerý text v
<p> - Seznamy - Položky ze
<ul>a<ol>
Ignorovaný obsah
ChattyBox automaticky ignoruje:
- Navigační menu
- Obsah v zápatí
- Skripty a styly
- Prvky
hidden,aria-hiddennebo s vloženým skrytím, rozpoznané bannery souhlasu a iframe/canvas/SVG.
Řešení problémů
Stránky se neextrahují?
- Zkontrolujte, že je URL veřejně přístupná
- Ověřte běžný HTML požadavek bez přihlášení, CAPTCHA či blokace botů; pravidla robots se nekontrolují
- Ověřte, že stránka není chráněná přihlášením
Chybí obsah v odpovědích?
- Znovu extrahujte stránku, abyste získali nejnovější obsah
- Důležitý text dodejte v počátečním HTML — JavaScript se nevykresluje
- Zajistěte, aby byl obsah v hlavní části stránky, ne v iframech
Potřebujete větší kontrolu?
Pokud máte pokročilejší požadavky na extrakci (ověřování, dynamický obsah apod.), kontaktujte nás na support@chattybox.ai.