Skanowanie treści
Skonfiguruj sposób, w jaki ChattyBox skanuje Twoją witrynę i indeksuje treści na potrzeby odpowiedzi AI.
W przypadku wdrożenia treści publicznych zobacz przewodnik po chatbotach AI dla witryn, aby dowiedzieć się, jak wybrać wiarygodną dokumentację, artykuły pomocy, strony produktów i FAQ przed przetestowaniem odpowiedzi z cytowaniami.
Tryby scrapingu
ChattyBox obsługuje cztery tryby scrapingu. Pobiera wyłącznie publiczny HTML: nie renderuje JavaScriptu i nie odczytuje ani nie egzekwuje robots.txt.
1. Tylko strona główna
Skanuje tylko Twoją stronę główną. To najlepsza opcja w przypadku prostych stron docelowych lub gdy chcesz zindeksować jak najmniej treści.
2. Tryb mapy witryny (zalecane)
Podaj adres URL mapy witryny, aby wykryć strony. Dotyczy to tylko tego samego originu, a filtry, limit stron i budżet odświeżeń nadal obowiązują; mapa witryny nie gwarantuje indeksacji każdej pozycji.
https://example.com/sitemap.xml
3. Tryb indeksowania (crawl)
Najpierw próbuje standardowych plików /sitemap.xml i /sitemap_index.xml; tylko gdy nie zwrócą adresów, śledzi linki z tego samego originu do głębokości 3. Nie uzupełnia niepełnej mapy witryny linkami.
4. Ręczne adresy URL
Podaj dokładne adresy URL do skanowania, po jednym w każdym wierszu. Użyj tej opcji, jeśli chcesz dokładnie określić, które strony mają być indeksowane.
https://example.com/pricing
https://example.com/features
https://example.com/about
https://example.com/faq
Limity stron
maxPages zapisuje żądanie; każde uruchomienie ogranicza wychodzące wykrywanie i wybór do min(żądanie, max(bieżąca pojemność stron dostawcy, znane istniejące strony projektu)). Przy zerowej lub odmówionej pojemności odświeżane są tylko znane istniejące strony; bez nich nie ma wychodzącego wykrywania nieznanych stron. Nie zmienia to uprawnień puli właściciela.
Limit zapisanych stron jest inny niż miesięczny budżet pracy odświeżania. Usunięcie adresu ze źródła nie usuwa już zapisanej strony.
| Plan | Strony w pakiecie |
|---|---|
| Free | 10 |
| Starter | 150 |
| Pro | 5,000 |
| Business | 25,000 |
Free ma budżet 500 odświeżeń miesięcznie, Starter 5 000, Pro 100 000, Business 250 000. Free odświeża najczęściej co tydzień, plany płatne co 24 godziny; zmienione i nowe strony zużywają budżet. PAYG stron nie znosi tej kadencji ani budżetu.
Postęp i częściowa indeksacja
Status Completed oznacza zakończenie zadania, nie pełne pokrycie. Porównaj liczbę zapisanych stron z listą Content; osobne zadanie embeddingów musi się zakończyć przed testem odpowiedzi. Tekst powyżej 512 KiB na stronę jest zachowywany tylko częściowo (Partially indexed / Completed with warnings). Przebudowa indeksu używa zapisanego tekstu, nie pobiera witryny, i także zużywa budżet oraz podlega cooldownowi.
Ekstrakcja treści
ChattyBox preferuje tekst z <main>, potem <article> lub role="main", a na końcu body:
- Tytuł strony - Znacznik
<title> - Nagłówki - Wszystkie znaczniki od
<h1>do<h6> - Akapity - Całą treść z
<p> - Listy - Elementy list
<ul>i<ol>
Ignorowana treść
ChattyBox automatycznie ignoruje:
- Menu nawigacyjne
- Treść stopki
- Skrypty i arkusze stylów
- Elementy
hidden,aria-hiddenlub z wbudowanym ukryciem, rozpoznane banery zgody oraz iframe/canvas/SVG.
Rozwiązywanie problemów
Strony nie są skanowane?
- Sprawdź, czy URL jest publicznie dostępny
- Sprawdź zwykłe żądanie HTML bez logowania, CAPTCHA ani blokady bota; reguły robots nie są sprawdzane
- Sprawdź, czy strona nie wymaga uwierzytelnienia
Brakuje treści w odpowiedziach?
- Zeskanuj stronę ponownie, aby pobrać najnowszą treść
- Ważny tekst podaj w początkowym HTML — JavaScript nie jest renderowany
- Upewnij się, że treść znajduje się w głównej części strony, a nie w iframe'ach
Potrzebujesz większej kontroli?
Jeśli masz zaawansowane potrzeby związane ze skanowaniem (uwierzytelnianie, dynamiczne treści itp.), skontaktuj się z nami pod adresem support@chattybox.ai.