Der Chatbot sammelt regelmäßig Informationen von Webseiten, die von euch hinterlegt werden, um Fragen der Nutzenden besser zu beantworten. Dafür erfasst er nächtlich die Textinhalte der hier hinterlegten Seiten (= Crawling) und speichert deren Textinhalte in einer Datenbank ab (= Indizierung / Indexierung).
Wenn du Änderungen an den Einstellungen vornimmst, dauert es bis zur nächsten wöchentlichen Indizierung, bis die neuen Inhalte verfügbar sind – der Chatbot schaut sich jede Seite erst beim Indizieren an.
Quellen hinzufügen und ausschließen
-
Navigiere im Admincenter zur „Wissensbasis“ und klicke oben auf den Reiter „Automatische Antworten“.
-
In diesem Bereich stehen dir Einstellungen (siehe pinke Markierungen) zur Verfügung, die im Folgenden erläutert werden.
Einsstiegsseiten für die Inhaltserfassung
Hier legst du fest, wo der Chatbot mit dem nächtlichen Einsammeln von Inhalten beginnt.
Hinweis zum Whitelisten des Crawlers
In manchen Fällen blockiert eine Website unseren Crawler – also die Software, die sich nächtlich die Texte von einer Website kopiert und in unserer Datenbank abspeichert. In diesem Fall muss die Website unseren User Agent zulassen:
viindCrawler/2.0 (https://www.viind.com/impressum/)
Wichtig: Die Versionsnummer des Crawlers (hier /2.0) kann sich im Laufe der Zeit ändern. Bitte berücksichtigt dies bei der Freigabe und entscheidet je nach technischer Möglichkeit, ob nur die aktuelle Version oder der viindCrawler unabhängig von der Versionsnummer zugelassen werden soll.
Wende dich dazu an deinen Website-Beauftragten, eine Person aus der Entwicklung oder an deine zuständige Agentur.
Hinweis zu hinterlegten URLs, die per „Client Side Rendering" laden
Diese können derzeit nicht vollständig von unserem Crawler (also der Software, die sich nächtlich die Texte von einer Website kopiert und in unserer Datenbank abspeichert) erfasst werden. Detaillierte Infos dazu ganz unten im FAQ.
Quellen für die Kontaktsuche (optional, aber empfohlen)
Diese Funktion ist Teil der neuen viind Search. Sie steht euch zur Verfügung, sobald euer Chatbot auf die neue Search umgestellt wurde. Wir informieren euch per E-Mail, sobald ihr umgestellt wurdet.
Wenn dein Chatbot Kontaktdaten oder Ansprechpartner aus eurer Website nennen soll, kann es vorkommen, dass er diese nicht zuverlässig aus dem allgemeinen Wissensbestand herausfiltern kann – zum Beispiel, weil die Kontaktinformationen über mehrere Seiten verteilt sind oder zwischen anderen Inhalten stehen.
Mit den Quellen für die Kontaktsuche kannst du dem Chatbot gezielt mitteilen, auf welchen Seiten er nach Kontaktdaten suchen soll. Trage dazu im Feld „Kontaktseiten-URLs" die Webadressen ein, auf denen Ansprechpartner oder Kontaktdaten zu finden sind.
Wie funktioniert es?
Wenn Nutzende eine Frage nach Kontakten oder Ansprechpartnern stellen, durchsucht der Chatbot bevorzugt die hier hinterlegten Seiten. Das führt zu präziseren Ergebnissen als die Suche im gesamten Wissensbestand.
Platzhalter für Unterseiten verwenden
Wenn sich Kontaktdaten auf mehreren Unterseiten befinden, kannst du im URL-Pfad einen Platzhalter (*) verwenden, um alle Seiten unterhalb einer bestimmten URL einzuschließen.
Beispiel: www.beispiel.de/ansprechpartner* erfasst auch Seiten wie www.beispiel.de/ansprechpartner/vertrieb oder www.beispiel.de/ansprechpartner/support.
Unsere klare Empfehlung
Das Pflegen der Kontakt-Quellen ist optional. Wir empfehlen es aber besonders dann, wenn ihr bereits eine oder mehrere Seiten mit Ansprechpartnern oder Kontaktdaten habt – der Chatbot kann diese Informationen dann wesentlich zuverlässiger ausgeben.
Seiten ausschließen (optional)
Du kannst hier bestimmte Seiten davon ausschließen, vom Chatbot gelesen zu werden – entweder durch das Eintragen kompletter URLs oder mit Hilfe von Regex-
Mustern (für Erklärung siehe Info-Icon).
Ausschluss per URL-Struktur:
Trage hier eine URL ein, um diese Seite sowie alle Seiten darunter (auf Basis der sprechenden URL-Struktur) von der Indizierung auszuschließen.
Beispiel: Wenn du www.beispiel.de/veranstaltungen/ einträgst, wird auch www.beispiel.de/veranstaltungen/feste/ ausgeschlossen.
Es werden alle Seiten ausgeschlossen, die hierarchisch in der sprechenden URL unterhalb der eingetragenen Adresse liegen.
Ausschluss per Regex:
Nutze reguläre Ausdrücke (Regex), um Seiten flexibler auszuschließen – z. B. basierend auf Schlagwörtern oder URL-Mustern.
Beispiel: .veranstaltung. schließt alle URLs aus, die das Wort „veranstaltung“ enthalten.
Regex steht für „Regular Expressions“ – das sind Muster zur Erkennung bestimmter Zeichenfolgen im Text. Falls du dir unsicher bist: Frag ChatGPT nach einem
passenden Regex oder nutze Seiten wie http://regex101.com zum Erstellen und Testen.
Erklärvideo
Im Video erklärt Philipp nochmal Schritt für Schritt, wie ihr Regex im Admincenter nutzen könnt und worauf ihr dabei achten solltet:
Dateiformate (optional)
Hier kannst du festlegen, ob von deinen hinterlegten Einstiegsseiten (siehe oben) auch Inhalte aus PDF-Dokumenten beim Indizieren berücksichtigt werden sollen.
Wenn diese Option aktiviert ist, werden PDF-Dateien auf den hinterlegten Seiten nach auslesbarem Text durchsucht.
Wichtig: Enthält ein PDF nur gescannte Bilder von Text (z. B. eingescanntes Papier), kann der Inhalt nicht verarbeitet werden. Auch Grafiken oder Diagramme in PDFs
werden nicht gespeichert – nur reiner Text wird vom Chatbot als Information übernommen.