Zum Hauptinhalt springen

Websites synchronisieren und verwalten

Wie man Fin mit öffentlichen URLs von Ihrer Website trainiert.

Wenn Sie Fin mit Website-Inhalten trainieren möchten, können Sie dies tun, indem Sie die öffentliche URL dieser Seite synchronisieren.


Loslegen

Gehen Sie zu Train > Content und wählen Sie dann unter dem Abschnitt "Inhalt hinzufügen" Website sync aus.

Geben Sie nun die öffentliche URL Ihrer Website (Top-Level-domain) ein und klicken Sie auf Weiter.

Dies ruft alle Seiten von der angegebenen Website-URL ab und liest alle Subdomain-Seiten aus.

Tipps:

Seiten zur Synchronisierung überprüfen

Sobald Sie Ihre URL eingegeben haben, prüfen wir, ob sie gültig und zugänglich ist. Dann müssen Sie die Seiten zur Synchronisierung überprüfen. Alle Unterseiten, die in jedem ausgewählten Abschnitt verlinkt sind, werden synchronisiert. Wählen Sie nur relevante und aktuelle Inhalte aus.

Tipps:

  • Wählen Sie Seiten und Abschnitte aus, die Support-Inhalte wie Hilfeartikel, Anleitungen oder FAQs enthalten.

  • Vermeiden Sie die Auswahl von Marketingseiten, Produktlisten oder Seiten mit komplexen Layouts.

  • Alle verlinkten Unterseiten innerhalb der ausgewählten Abschnitte werden automatisch einbezogen.

  • Sie können Ihre Auswahl später jederzeit in den erweiterten Einstellungen aktualisieren.

Erweiterte Einstellungen [optional]

Wählen Sie das Dropdown-Menü Erweiterte Einstellungen aus, um zusätzliche URLs zu konfigurieren, URLs auszuschließen, CSS-Selektoren zum Ausschluss festzulegen und mehr.

Zusätzliche URLs

Website-Strukturen können variieren. Um sicherzustellen, dass wir Ihre relevantesten Inhalte synchronisieren, empfehlen wir, zusätzliche URLs für bestimmte Unterseiten hinzuzufügen.

Wenn Sie beispielsweise https://myhelpcenter.com/help als primäre URL oben eingeben, möchten Sie möglicherweise auch die spezifische URL wie https://myhelpcenter.com/help/index.html hinzufügen.

Auszuschließende URLs

Um bestimmte Seiten auszuschließen, von denen Sie keine Inhalte synchronisieren möchten, können Sie eine Liste von URL-Globs hinzufügen.

Was ist ein URL-Glob?

Ein Glob ist eine Zeichenkette aus Literal- und/oder Platzhalterzeichen, die verwendet wird, um Dateipfade oder URLs abzugleichen. Globbing ist das Auffinden von Dateien in einem Dateisystem mithilfe von einem oder mehreren Globs. Die Verwendung von URL-Globs hilft auch, eine Reihe von URLs zu erfassen, die größtenteils gleich sind, wobei nur ein kleiner Teil zwischen den Anfragen variiert.

Zum Beispiel erlaubt dieser URL-Glob https://{store,docs}.example.com/** dem Crawler den Zugriff auf alle URLs, die mit https://store.example.com/ oder https://docs.example.com/ beginnen, und https://example.com/**/*\?*foo=*

Tipp: Sie sind sich nicht sicher, ob Ihr Glob-Muster die URLs, die Sie ausschließen möchten, abdeckt? Sie können DigitalOcean's Glob Tool verwenden, um Muster gegen Beispiel-URLs zu testen, bevor Sie sie anwenden. (Dies ist ein Drittanbieter-Tool, das nicht von Intercom gepflegt wird.)

Auszuschließende CSS-Selektoren

Um bestimmte Seitenelemente auszuschließen, können Sie CSS-Selektoren für die spezifischen Abschnitte oder Elemente verwenden, die Sie ausschließen möchten.

Dies ist nützlich, um irrelevante Seiteninhalte zu überspringen. Der Wert muss ein gültiger CSS-Selektor sein, wie er von der Funktion document.querySelectorAll() akzeptiert wird. Standardmäßig entfernen wir bereits häufige Navigationselemente, Kopf- und Fußzeilen, Modale und Skripte.

Hinweis: Bilder werden jetzt standardmäßig beim Synchronisieren von Websites erfasst. Um zu steuern, wie Fin Bilder und GIFs in Antworten verwendet, siehe Using images and GIFs in Fin AI Agent replies.

Klickbarer CSS-Selektor

Dies ermöglicht es, DOM-Elemente, die durch den CSS-Selektor identifiziert werden, während des Web-Synchronisationsprozesses anzuklicken.

Dies ist nützlich, um eingeklappte Abschnitte zu erweitern, um deren Textinhalt zu erfassen. Der Wert muss ein gültiger CSS-Selektor sein, wie er von der Funktion document.querySelectorAll() akzeptiert wird.

Beispiele sind "[aria-expanded=\"false\"]", #expand_section

Komplexe Bedingungen können auch mit einem CSS-Selektor beschrieben werden. In CSS erzeugt das Aneinanderreihen von Selektoren ohne Leerzeichen eine UND-ähnliche Bedingung, z. B. .button.blue.small passt nur zu Elementen mit allen drei Klassen.

Die Verwendung von Komma (,) als Trennzeichen funktioniert wie ODER, z. B. .button, .blue, h1 zielt auf alle Elemente mit der Klasse button, oder der Klasse blue, oder Überschriften der ersten Ebene ab.

Auf das Laden des CSS-Selektors warten

Um Inhalte anzusprechen, die möglicherweise verzögert auf der Seite erscheinen, können Sie einen CSS-Selektor hinzufügen, der den Web-Scraper vor dem Abrufen des Inhalts warten lässt.

Dies ist nützlich für Seiten, bei denen die standardmäßige Erkennung des Inhaltsladezustands durch ein inaktives Netzwerk fehlschlägt. Das Setzen dieser Option deaktiviert das Standardverhalten vollständig, und die Seite wird nur verarbeitet, wenn das durch diesen Selektor angegebene Element erscheint.

Hinweis: Der Wert muss ein gültiger CSS-Selektor sein, wie er von der Funktion document.querySelectorAll() akzeptiert wird.

XML-Sitemap

Aktivieren Sie die XML-Sitemap für eine robustere Web-Synchronisation auf Websites mit Sitemap-Unterstützung, um Zugriff auf Seiten zu ermöglichen, die von den ursprünglichen URLs möglicherweise nicht erreichbar sind.

Wenn diese Option aktiviert ist, sucht der Web-Scraper nach Sitemaps in den Domains der angegebenen Quell-URL und fügt passende URLs ähnlich wie die auf gecrawlten Seiten gefundenen Links in die Warteschlange ein. Sie können auch direkt auf eine sitemap.xml-Datei verweisen, indem Sie sie als weitere Start-URL hinzufügen, z. B. https://www.example.com/sitemap.xml.

Proxy-Region

Sie können einen Proxy auswählen, den der Crawler verwenden soll, wenn Ihre Website mit einem Proxy aus einer bestimmten Region oder einem bestimmten Land gecrawlt werden soll.

Wir unterstützen derzeit folgende Proxys:

  • Rotierend: Vereinigte Staaten, Deutschland, Frankreich, Vereinigtes Königreich, Tschechien, Ungarn

  • Statisch:

    • Vereinigte Staaten - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • Australien - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

Crawler-Typ

Wählen Sie, wie gründlich der Crawler jede Seite rendert, während diese Website synchronisiert wird.

  • Leere oder abgeschnittene Seiten beim Synchronisieren bedeuten meist JavaScript-Rendering. Wechseln Sie zu Vollständig und synchronisieren Sie erneut.

  • Vollständig ist ressourcenintensiver, daher wird eine große Quelle eher seltener synchronisiert.

  • Sie können dies bei einer bestehenden Quelle ändern und zum Vergleich erneut synchronisieren.

Option

Was es bewirkt

Wann es verwendet wird

Schnell

Liest HTML, ohne JavaScript auszuführen.

Der Inhalt befindet sich im initialen HTML – die meisten Blogs, Dokumentationen, help center.

Auto (Standard)

Wir wählen aus und wechseln zu Vollständig, wenn die Seite JavaScript benötigt.

Sie sind unsicher. Für fast alle geeignet.

Vollständig

Lädt jede Seite in einem Browser und führt JavaScript aus. Langsamer.

Inhalte erscheinen erst nach Ausführung von Skripten, Single-Page-Apps, JavaScript-lastige Seiten.

Kanonische URLs ignorieren

Wenn aktiviert, ignoriert der Web-Scraper kanonische Link-Tags (rel="canonical") und behandelt jede URL als eigene Seite. Diese Option ist standardmäßig deaktiviert.

Dies ist nützlich, wenn eine Website viele Seiten auf eine kanonische URL verweist und dadurch Inhalte verloren gehen.

Abfrageparameter ausschließen und robots.txt respektieren

Unter Erweiterte Einstellungen gibt es zwei weitere Schalter. Beide sind standardmäßig deaktiviert.

robots.txt respektieren: sorgt dafür, dass der Crawler die Disallow-Regeln in der robots.txt Ihrer Website befolgt. Aktivieren Sie dies, um die Synchronisierung mit dem, was Sie anderen Crawlern erlauben, konsistent zu halten. Wenn robots.txt Pfade verbietet, die Inhalte enthalten, die Sie in Fin möchten, reduziert dies die synchronisierten Inhalte.

Abfrageparameter ausschließen: überspringt jede URL mit einer Abfragezeichenfolge (?). Aktivieren Sie dies, wenn Ihre Website Tracking-, Sitzungs- oder Sortierparameter anhängt, die viele nahezu doppelte Seiten erzeugen. Lassen Sie es deaktiviert, wenn sich echter Inhalt hinter einer Abfragezeichenfolge verbirgt, z. B. /docs?page=intro – diese Seiten würden sonst ebenfalls übersprungen.

Zielgruppen

Der Ziel-Schritt ermöglicht es Ihnen, eine Standardzielgruppe für alle synchronisierten Seiten festzulegen und URL-basierte Regeln zu erstellen, um automatisch bestimmte Zielgruppen basierend auf URL-Mustern zuzuweisen – keine manuelle Kennzeichnung erforderlich.

Entscheiden Sie zuerst, ob Inhalte aus dieser Quelle für Fin AI Agent und/oder Copilot aktiviert sind.

Dann können Sie entweder eine Standard-Fin-Zielgruppe festlegen, die für alle von dieser Quelle synchronisierten Seiten gilt (wenn keine Standardzielgruppe festgelegt ist, gilt Jeder), oder Regeln erstellen, um bestimmte Zielgruppen basierend auf URL-Mustern zuzuweisen.

Zum Beispiel: Wenn die URL /uk enthält, weise die UK-Zielgruppe zu. Regeln werden während der Synchronisierung ausgewertet, sodass Fin und Copilot immer die richtigen Inhalte für die richtige Zielgruppe bereitstellen.

Jede Regel unterstützt drei URL-Vergleicher:

  • Beginnt mit — passt zu URLs, die mit einem bestimmten Präfix beginnen.

  • Endet mit — passt zu URLs, die mit einem bestimmten Suffix enden.

  • Enthält — passt zu URLs, die eine bestimmte Teilzeichenfolge enthalten.

Hinweis:

  • Eine Live-Vorschau zeigt, wie viele Seiten jeder Regel entsprechen, was Ihnen hilft, Regeln vor dem Speichern zu validieren. Dies erfordert eine Sitemap für Ihre Web-Synchronisierungsquelle. Ohne Sitemap gelten die Regeln weiterhin, aber Sie können keine Übereinstimmungen vorschauen.

  • Regeln werden bei der Erstellung automatisch benannt, können aber umbenannt werden. Es gilt ein Maximum von 10 Regeln pro Web-Synchronisierungsquelle.

  • Zielgruppenregeln sind nur additiv: Sie fügen Zielgruppen zu Inhalten hinzu, entfernen aber keine bestehenden Zuordnungen. Das Entfernen einer Regel macht ihre früheren Zielgruppen-Zuordnungen nicht rückgängig.

Synchronisierungseinstellungen überprüfen

Überprüfen Sie abschließend Ihre Synchronisierungseinstellungen und klicken Sie dann auf Website synchronisieren, um mit der Synchronisierung Ihrer Website-Inhalte mit Intercom zu beginnen.


Website-Quellen verwalten

Nach Abschluss der Synchronisierung erhalten Sie eine E-Mail-Benachrichtigung und die Website erscheint als synchronisierte Quelle unter Train > Content im Abschnitt "Content sources".

Wenn Sie eine Website-Quelle öffnen, können Sie die einzelnen Seiten, die von der öffentlichen URL synchronisiert wurden, ansehen und verwalten.

Hinweis: Website-Quellen sind schreibgeschützt und können nicht innerhalb Ihres Fin-Arbeitsbereichs bearbeitet werden, sie müssen an der Quelle bearbeitet werden.

Einstellungen konfigurieren

Wenn Sie eine Website-Seite ansehen, finden Sie auf der rechten Seite ein "Details"-Panel, das Folgendes enthält:

  • Daten: Zeigt den Inhaltstyp, die Sprache, das Erstellungsdatum und das letzte Update (wann zuletzt mit der Quelle synchronisiert) an.

  • Fin: Aktivieren/deaktivieren für Fin Agent und Fin Copilot. Wenn aktiviert, werden die Inhalte für Kunden bzw. Teammitglieder verfügbar.

    • Planung: Schalten Sie Inhalte für Fin und Copilot an festgelegten Daten ein oder aus.

    • Zielgruppe: Stellen Sie sicher, dass Kunden nur Antworten erhalten und Inhalte von Fin Agent sehen, die für sie relevant sind.

  • Link: Die öffentliche URL für diese Website-Quelle.

  • Berichte: Verfolgt, wie oft dieser Inhalt verwendet wird, um Gespräche durch Fin Agent zu lösen.

  • Tag: Fügen Sie einen Tag hinzu, um Webseiten zu gruppieren und Inhalte organisiert zu halten.

Machen Sie es für Fin oder Copilot verfügbar

Um eine Website-Quelle für Fin Agent oder Fin Copilot verfügbar zu machen, gehen Sie zu Train > Content und klicken Sie auf die Website-Quelle unter dem Abschnitt "Content sources", öffnen Sie dann die relevante Webseite, die Sie synchronisiert haben.

Im "Details" Panel scrollen Sie nach unten zu „Fin“ und schalten Sie um:

  • Fin Agent - Diese Einstellung macht die Webseite für Fin AI verfügbar, um Kunden zu antworten (es werden alle Zielgruppenregeln beachtet).

  • Fin Copilot - Diese Einstellung macht die Webseite für Fin Copilot verfügbar, um Teamkollegen zu antworten.

Verfügbarkeit der Website planen

Sie können planen, wann synchronisierte Webseiten für Fin und Copilot an einem zukünftigen Datum, einer Uhrzeit und Zeitzone ein- oder ausgeschaltet werden. Legen Sie nur ein Startdatum fest oder sowohl Start- als auch Enddatum, um ein zeitlich begrenztes Verfügbarkeitsfenster zu erstellen. Die Planung gilt für einzelne Seiten oder in großen Mengen.

Eine einzelne Seite planen

  1. Öffnen Sie die Seite. Im rechten Details-Panel finden Sie den Abschnitt Planung im Fin-Dropdown.

  2. Klicken Sie auf Verfügbarkeit planen.

  3. Wählen Sie im Modal das KI-Produkt (Fin für Service oder Fin Copilot), stellen Sie die Verfügbarkeit ein (Aktivieren oder Deaktivieren) und wählen Sie Datum, Uhrzeit und Zeitzone.

  4. Optional können Sie Enddatum festlegen umschalten, um ein Enddatum und eine Uhrzeit hinzuzufügen — die Aktion wird dann automatisch rückgängig gemacht.

  5. Klicken Sie auf Planen, um zu bestätigen.

Seiten in großen Mengen planen

  1. Wählen Sie mehrere Seiten aus der Inhaltsliste aus.

  2. Gehen Sie zum Dropdown Weitere Aktionen und wählen Sie Verfügbarkeit planen.

  3. Das gleiche Planungsmodal gilt für alle ausgewählten Elemente.

Wie die Planung funktioniert

  • Nur Startdatum: Die Aktivierungs-/Deaktivierungsaktion wird zur geplanten Zeit ausgeführt und bleibt wirksam, bis Sie sie manuell ändern.

  • Start- + Enddatum: Inhalte werden zur Startzeit ein- (oder ausgeschaltet) und kehren dann automatisch zur Endzeit zurück.

  • Manuelle Änderungen heben eine geplante Aktion nicht auf: Wenn Sie die Verfügbarkeit nach dem Festlegen eines Plans manuell umschalten, wird die geplante Änderung trotzdem zur geplanten Zeit ausgeführt und überschreibt Ihre manuelle Änderung.

  • Ein geplanter Termin pro Element und Agent: Das Festlegen eines neuen Plans ersetzt den vorherigen — keine Duplikate.

  • Gelöschte Inhalte: Wenn eine Seite vor Ausführung des Plans gelöscht wird, gilt der Plan einfach nicht und es wird kein Fehler angezeigt.

Für eine bestimmte Zielgruppe verfügbar machen

Sie können Zielgruppen für synchronisierte Inhalte automatisch mit URL-basierten Regeln während der Web-Synchronisation erstellen oder manuell pro Seite zuweisen. Zuerst müssen Sie die Zielgruppe erstellen und definieren, die Sie ansprechen möchten.

Gehen Sie dann zu Train > Content und klicken Sie auf die Website-Quelle unter dem Abschnitt "Content sources", öffnen Sie dann die relevante Webseite, die Sie synchronisiert haben.

Im "Details" Panel scrollen Sie nach unten zu „Fin“ und wählen Sie im Zielgruppen-Dropdown eine Ihrer vordefinierten Zielgruppen aus.

Hinweis:

  • Die Standardzielgruppe für öffentliche URLs ist „Jeder“.

  • Fin Agent respektiert auch jede Zielgruppe, die Sie auf eine öffentliche URL anwenden, und verwendet diesen Artikel nur, um Kundenfragen zu beantworten, wenn sie den Zielgruppenregeln entsprechen.

Zielgruppenregeln bei bestehenden Synchronisationen hinzufügen oder bearbeiten

Sie müssen eine Synchronisation nicht neu erstellen, um Zielgruppen-Targeting hinzuzufügen. Gehen Sie zu Train > Content, wählen Sie die Quelle aus, klicken Sie auf das Einstellungs-Dropdown oben rechts und wählen Sie Einstellungen öffnen. Navigieren Sie zum Schritt Ziel, um URL-basierte Regeln hinzuzufügen oder zu bearbeiten.

Hinweis: Wenn Zielgruppenregeln zu einer bestehenden Web-Synchronisation hinzugefügt werden, gelten sie rückwirkend für alle bereits aus dieser Quelle aufgenommenen Inhalte — nicht nur für neue Inhalte.

Website als Quelle erneut synchronisieren oder entfernen

Wenn Sie eine öffentliche URL als Quelle erneut synchronisieren oder entfernen möchten, gehen Sie zu Train > Content und klicken Sie auf die Website-Quelle unter dem Abschnitt "Content sources", öffnen Sie dann das Dropdown Einstellungen oben rechts.

Hier können Sie auswählen, ob Sie Erneut synchronisieren oder Diese Quelle entfernen möchten.

Tipp: Änderungen auf Ihrer Quell-Website erscheinen nicht sofort in Intercom. Website-Neusynchronisierungen erfolgen automatisch jede Woche, aber Sie können jederzeit eine manuelle Neusynchronisierung auslösen, um die neuesten Inhalte früher anzuzeigen.

Website-Synchronisationsverlauf anzeigen

Sie können eine Liste vergangener Website-Synchronisationen einsehen, um zu sehen, wann sie zuletzt ausgeführt wurden, welche Seiten gefunden wurden und welche Seiten fehlgeschlagen sind. Gehen Sie zu Train > Content und klicken Sie auf die Website-Quelle unter dem Abschnitt "Content sources", wählen Sie dann Synchronisationsverlauf anzeigen.


Jede Zeile in der Tabelle stellt einen vergangenen oder aktiven Lauf dar, und Sie können die Läufe nach Status (gestartet, erfolgreich, fehlgeschlagen) filtern.

Es enthält folgende Informationen:

  • Synchronisationsdatum

  • Status

  • Synchronisierte Seiten

  • Ausgeschlossene Seiten

  • Fehlgeschlagene Seiten

  • Dauer

  • Synchronisierung gestartet von

Wenn eine Synchronisierung fehlgeschlagen ist, können Sie mit der Maus über den Status fahren, um eine detaillierte Erklärung zu erhalten.

Automatische Synchronisierungen pausieren, wenn Fin keine Website verwendet

Eine neue Quelle synchronisiert in den ersten 90 Tagen planmäßig. Danach synchronisiert sie automatisch weiter, wenn eine der folgenden Bedingungen zutrifft:

  • Eine Seite davon wurde in den letzten 90 Tagen in einer Fin-Antwort verwendet.

Andernfalls pausieren geplante Synchronisierungen.

Wenn pausiert: Seiten bleiben in Ihrem Knowledge Hub und sind für Fin und Copilot verfügbar (nichts wird gelöscht). Nur das erneute Crawlen stoppt, sodass Änderungen auf Ihrer Website nicht erfasst werden.

Zum Wiederherstellen: Die Schaltfläche Jetzt synchronisieren aktualisiert den Inhalt einmal, startet aber den Zeitplan nicht neu. Die automatische Synchronisierung wird fortgesetzt, sobald Fin die Quelle wieder verwendet.

Websites, die schwer zu crawlen sind, synchronisieren seltener

Sehr große Websites und solche, die vollständiges JavaScript-Rendering benötigen, verursachen deutlich höhere Crawling-Kosten. Wenn eine Quelle ressourcenintensiv ist, verschieben wir sie von einem wöchentlichen auf einen 14-tägigen Zeitplan.

Dies geschieht automatisch pro Quelle. Um eine große Website auf einem schnelleren Zeitplan zu halten, schränken Sie das Crawlen durch URL-Ausschlüsse ein oder fügen Sie spezifische Unterseiten statt einer ganzen domain hinzu.


Fehlerbehebung bei der Website-Synchronisierung

Häufige Probleme

Beim Import von Website-Inhalten zur Aktivierung von Fin müssen Sie die öffentliche URL eingeben. Diese sucht alle Seiten unter dieser URL und synchronisiert sie für die Nutzung durch Fin AI Agent.

Wenn der Importeur nicht die erwartete Seitenanzahl zurückgegeben hat, gibt es einige Gründe...

Die angegebene URL ist nicht die Top-Level-domain

Die Website-Synchronisierung funktioniert, indem die von Ihnen angegebene URL aufgerufen und alle darunter verschachtelten Seiten gesucht werden. Diese Seiten müssen dasselbe URL-Muster wie die angegebene URL haben.

Zum Beispiel, wenn die Top-Level-domain https://myhelpcenter.com/home ist, müssen alle zu importierenden Seiten den Präfix /home in der URL enthalten, z. B. https://myhelpcenter.com/home/article. Wenn nicht, entfernen Sie den Präfix und verwenden Sie den grundlegendsten URL-Stamm, z. B. https://myhelpcenter.com, und versuchen Sie den Import erneut.

Die URL ist privat

Wenn der Inhalt, den Sie verwenden möchten, hinter einer Anmeldung liegt, kann Fin nicht darauf zugreifen oder ihn importieren.

Seitenlimits

Die Website-Synchronisierung hat zwei Limits:

  • Domains: Sie können bis zu 100 verschiedene Top-Level-domains synchronisieren.

  • Seiten pro Quelle: Fin synchronisiert maximal 4.000 Seiten pro Quelle.

Eine Synchronisierung kann auch fehlschlagen, wenn eine einzelne Seite sehr viel Inhalt enthält. Sie werden per E-Mail benachrichtigt, wenn eine Synchronisierung fehlschlägt.

Hinweis:

  • Wenn eine Quelle mehr als 4.000 Seiten hat, teilen Sie sie in mehrere Quellen auf, damit jede unter dem Limit bleibt:

    • Teilen Sie die Website in kleinere Abschnitte und fügen Sie jeden Abschnitt als eigene Quelle hinzu.

    • Synchronisieren Sie verschiedene URL-Pfade separat, z. B. eine Quelle pro Produktbereich oder Kategorie.

  • So bleibt jede Quelle unter dem Seitenlimit und die verarbeiteten Inhalte pro Synchronisierung werden reduziert.

Websites, die auf bestimmte regionale IPs beschränkt sind

Die Website-Synchronisierung von Fin (zum Hinzufügen öffentlicher URLs für Fin AI Agent und Copilot) verwendet derzeit keinen dedizierten, benutzerdefinierten User-Agent-String.

Wenn Ihre Website strengen Anti-Crawling-Schutz hat, können Sie einen statischen Proxy verwenden, um eine feste IP-Adresse auf die Whitelist zu setzen und sicherzustellen, dass Ihre Inhalte erfasst werden. Wählen Sie einen statischen Proxy unter Erweiterte Einstellungen, wenn Sie Ihre Website-Synchronisierung erstellen oder bearbeiten.

  • Nach IP-Adresse: Wenn Ihre Website eine Whitelist erfordert, wählen Sie unter Erweiterte Einstellungen einen statischen Proxy – so erhalten Sie eine feste IP-Adresse, die Sie auf die Whitelist setzen können.

  • Diese Anfragen werden nur für die Website-Synchronisierung verwendet. Sie beeinflussen nicht Ihren Messenger-Verkehr oder das Endbenutzer-Tracking.

Seiten von nicht-englischen oder internationalen Websites werden nicht synchronisiert

Wenn Ihre Sitemap URLs mit nicht-ASCII-Zeichen enthält (z. B. Akzentbuchstaben oder Schriftsysteme wie Chinesisch oder Arabisch), werden einige dieser Seiten möglicherweise nicht wie erwartet synchronisiert. Die Sitemap-Erkennung unterstützt diese URLs jetzt, aber es kann in anderen Teilen des Synchronisierungsprozesses weiterhin Probleme geben. Versuchen Sie, manuell erneut zu synchronisieren. Wenn Seiten weiterhin fehlen, wenden Sie sich an den Support.

Fehler bei der Website-Synchronisierung

Wenn Sie Website-Inhalte synchronisieren, können verschiedene Status angezeigt werden, die den Verlauf des Prozesses anzeigen. Um den Status Ihrer Website-Synchronisierung zu sehen, gehen Sie zu Train > Content und wählen Sie die Website-Quelle aus. Verwenden Sie dann das Dropdown-Menü Status, um zu filtern nach:

  • Synchronisierung läuft

  • Live

  • Fehlgeschlagen

  • Ausgeschlossen

Das bedeutet jeder Status und was Sie als Nächstes tun können:

Synchronisierung läuft

Die Seitensynchronisierung ist noch im Gange. Eine erste Synchronisierung kann je nach Inhalt von wenigen Minuten bis über eine Stunde dauern.

Live

Die Seite wurde erfolgreich synchronisiert und kann für Fin und Copilot aktiviert werden.
​

Hinweis: Ein erfolgreicher Sync bedeutet nicht immer, dass wir alle Inhalte der Seite erfassen konnten. Um die vollständige Abdeckung zu bestätigen, empfehlen wir, Fin mit den erwarteten Antworten von dieser Seite vorzuschauen.

Ausgeschlossen

Diese Seiten werden absichtlich nicht synchronisiert, da Sie sie in den Erweiterten Sync-Einstellungen ausgeschlossen haben. Sie können nicht erneut versucht oder eingeschlossen werden, sofern nicht anders angegeben.

Fehlgeschlagen

Diese Fehler bedeuten, dass der Sync nicht abgeschlossen wurde und möglicherweise Änderungen Ihrerseits erfordert, bevor Sie es erneut versuchen:

1. Unbekannter Fehler

  • Nachricht: „Auf diese Seite konnte nicht zugegriffen werden. Sie ist möglicherweise langsam oder blockiert. Versuchen Sie es erneut zu synchronisieren oder kontaktieren Sie den Support, wenn es fehlschlägt.“

  • Was es bedeutet: Etwas hat uns daran gehindert, auf die Seite zuzugreifen, aber die Ursache ist unklar.

2. Sitzung blockiert / Rate begrenzt

  • Nachricht: „Die Website verhindert den Zugriff auf ihre Inhalte. Prüfen Sie, ob sie durch eine Anti-Crawler-Einstellung oder Firewall blockiert wird. Überprüfen Sie Ihre Seitenkonfiguration und versuchen Sie es erneut. Wenn das Problem weiterhin besteht, kontaktieren Sie den Support.“

  • Was es bedeutet: Ihre Seite blockiert oder begrenzt unseren Crawler aktiv.

3. Netzwerk-, Zeitüberschreitungs- oder ähnliche Fehler

  • Nachricht: „Auf diese Seite konnte nicht zugegriffen werden. Sie lädt möglicherweise langsam oder wird durch Anti-Crawler-Einstellungen oder eine Firewall blockiert. Überprüfen Sie Ihre Seitenkonfiguration und versuchen Sie es erneut. Wenn das Problem weiterhin besteht, kontaktieren Sie den Support.

  • ​Was es bedeutet: Die Seite wurde nicht rechtzeitig geladen oder konnte aufgrund von Netzwerkproblemen oder Blockierungen nicht erreicht werden.

    Was zu tun ist: Ein "Navigation timeout"-Fehler wird oft durch Bot-Schutz oder Sicherheitssoftware auf Ihrer Seite verursacht, die den Intercom-Copilot blockiert. Um dies zu beheben, setzen Sie die statischen Proxy-IP-Adressen aus dem Abschnitt Erweiterte Einstellungen oben auf die Whitelist, wählen Sie dann die passende Proxy-Region unter Erweiterte Einstellungen beim Erstellen oder Bearbeiten Ihres Website-Syncs aus und versuchen Sie den Sync erneut.

4. Duplikat

  • Nachricht: „Diese Seite hat denselben Inhalt wie eine andere, die bereits synchronisiert wurde. Es wird nur eine Version eingeschlossen.“

  • Was es bedeutet: Wir haben identische Inhalte an anderer Stelle erkannt, daher wird nur eine Kopie behalten.

5. Schlüsselwortfilterung

  • Nachricht: „Seiten mit Schlüsselwörtern wie category, collection oder tag in der URL sind standardmäßig ausgeschlossen, da sie normalerweise keine einzigartigen Inhalte enthalten. Wenn diese Seite eingeschlossen werden soll, kontaktieren Sie den Support.“

  • Was es bedeutet: Diese URLs stellen oft Listen dar, keine eigenständigen Inhaltsseiten.

6. Statuscode 400

  • Nachricht: „Seiteninhalt kann nicht gefunden werden. Überprüfen Sie, ob die URL gültig ist und die Seite ohne Probleme lädt.

  • ​Was es bedeutet: Die URL ist möglicherweise defekt oder gibt auf Ihrer Website einen Fehler zurück.

7. Blockierte URL

  • Nachricht: „Diese Website domain ist vom Sync ausgeschlossen. Wenn Sie dies benötigen, kontaktieren Sie den Support.“

  • Was es bedeutet: Die domain ist absichtlich vom Sync ausgeschlossen.


​Sie können einen fehlgeschlagenen Seiten-Sync erneut versuchen, indem Sie mit der Maus über die Seite fahren, das Drei-Punkte-Menü auswählen und dann Erneut synchronisieren wählen.

Hat dies deine Frage beantwortet?