Zum Hauptinhalt springen

Synchronisieren und Websites verwalten

So trainieren Sie Fin mit öffentlichen URLs Ihrer Website.

Wenn Sie Fin mit Website-Inhalten trainieren möchten, können Sie dies tun, indem Sie die öffentliche URL dieser Website synchronisieren.


Loslegen

Gehen Sie zu Train > Content und wählen Sie dann unten im Bereich „Inhalte hinzufügen“ Website sync aus.

Geben Sie nun die öffentliche URL Ihrer Website (Top-Level domain) ein und klicken Sie auf Weiter.

Dies ruft alle Seiten der von Ihnen angegebenen Website-URL ab und liest alle Subdomain-Seiten.

Tipps:

Seiten zur Synchronisierung überprüfen

Nachdem Sie Ihre URL eingegeben haben, prüfen wir, ob sie gültig und zugänglich ist. Anschließend müssen Sie die Seiten zur Synchronisierung überprüfen. Alle in jedem ausgewählten Abschnitt verlinkten Unterseiten werden synchronisiert. Wählen Sie nur relevante, aktuelle Inhalte aus.

Tipps:

  • Wählen Sie Seiten und Abschnitte aus, die Support-Inhalte wie Hilfsartikel, Anleitungen oder FAQS enthalten.

  • Vermeiden Sie die Auswahl von Marketingseiten, Produktlisten oder Seiten mit komplexen Layouts.

  • Alle verlinkten Unterseiten innerhalb ausgewählter Abschnitte werden automatisch eingeschlossen.

  • Sie können Ihre Auswahl später jederzeit in den erweiterten Einstellungen aktualisieren.

Erweiterte Einstellungen [optional]

Wählen Sie das Dropdown Erweiterte Einstellungen aus, um zusätzliche URLs, auszuschließende URLs, auszuschließende CSS-Selektoren und mehr zu konfigurieren.

Zusätzliche URLs

Website-Strukturen können variieren. Um sicherzustellen, dass wir Ihre relevantesten Inhalte synchronisieren, empfehlen wir, zusätzliche URLs für bestimmte Unterseiten hinzuzufügen.

Wenn Sie beispielsweise https://myhelpcenter.com/help als primäre URL oben eingeben, möchten Sie möglicherweise auch die spezifische URL wie https://myhelpcenter.com/help/index.html hinzufügen.

Auszuschließende URLs

Um bestimmte Seiten auszuschließen, von denen Sie keinen Inhalt synchronisieren möchten, können Sie eine Liste von URL-Globs hinzufügen.

Was ist ein URL-Glob?

Ein Glob ist eine Zeichenfolge aus Literal- und/oder Platzhalterzeichen, die zum Abgleichen von Dateipfaden oder URLs verwendet wird. Globbing ist die Aktion des Auffindens von Dateien in einem Dateisystem mithilfe von einem oder mehreren Globs. Die Verwendung von URL-Globs hilft auch dabei, einen Bereich von URLs zu erhalten, die größtenteils gleich sind, wobei nur ein kleiner Teil zwischen den Anfragen variiert.

Zum Beispiel lässt dieser URL-Glob https://{store,docs}.example.com/** den Crawler auf alle URLs zugreifen, die mit https://store.example.com/ oder https://docs.example.com/ beginnen, und https://example.com/**/*\?*foo=*

Tipp: Sind Sie sich nicht sicher, ob Ihr Glob-Muster die auszuschließenden URLs abdeckt? Sie können DigitalOcean's Glob Tool verwenden, um Muster gegen Beispiel-URLs zu testen, bevor Sie sie anwenden. (Dies ist ein Drittanbieter-Tool, das nicht von Intercom gewartet wird.)

Auszuschließende CSS-Selektoren

Um bestimmte Seitenelemente auszuschließen, können Sie CSS-Selektoren der spezifischen Abschnitte oder Elemente verwenden, die Sie ausschließen möchten.

Dies ist nützlich, um irrelevante Seiteninhalte zu überspringen. Der Wert muss ein gültiger CSS-Selektor sein, wie ihn die Funktion document.querySelectorAll() akzeptiert. Standardmäßig entfernen wir bereits gängige Navigationselemente, Kopfzeilen, Fußzeilen, Modale, Skripte und Inline-Bilder.

Klickbarer CSS-Selektor

Dies ermöglicht es, dass DOM-Elemente, die durch den CSS-Selektor identifiziert werden, während des Web-Sync-Vorgangs angeklickt werden.

Dies ist nützlich, um zusammengeklappte Abschnitte zu erweitern, um deren Textinhalt zu erfassen. Der Wert muss ein gültiger CSS-Selektor sein, wie ihn die Funktion document.querySelectorAll() akzeptiert.

Beispiele sind "[aria-expanded=\"false\"]", #expand_section

Komplexe Bedingungen können auch mit einem CSS-Selektor beschrieben werden. Im CSS erzeugt das Aneinanderreihen von Selektoren ohne Leerzeichen eine UND-ähnliche Bedingung, zum Beispiel .button.blue.small passt nur zu Elementen mit allen drei Klassen.

Die Verwendung von Komma (,) als Trenner funktioniert wie ODER, zum Beispiel .button, .blue, h1 zielt auf alle Elemente mit der Klasse button, oder der Klasse blue, oder auf Überschriften der ersten Ebene.

Warten, um CSS-Selektor zu laden

Um Inhalte anzusprechen, die mit Verzögerung auf der Seite erscheinen können, können Sie einen CSS-Selektor hinzufügen, der den Web-Scraper vor dem Scrapen warten lässt.

Dies ist nützlich für Seiten, bei denen die standardmäßige Erkennung des Inhaltsladens durch Leerlauf des Netzwerks fehlschlägt. Das Aktivieren dieser Option deaktiviert das Standardverhalten vollständig, und die Seite wird nur verarbeitet, wenn das durch diesen Selektor angegebene Element erscheint.

Hinweis: Der Wert muss ein gültiger CSS-Selektor sein, wie ihn die Funktion document.querySelectorAll() akzeptiert.

XML-Sitemap

Aktivieren Sie die XML-Sitemap für einen robusteren Websync auf Sitemap-unterstützten Websites, damit Seiten zugänglich werden, die von den anfänglichen URLs möglicherweise nicht erreichbar sind.

Wenn diese Option aktiviert ist, sucht der Web-Scraper auf den Domains der bereitgestellten Quell-URL nach Sitemaps und fügt übereinstimmende URLs ähnlich wie die auf gecrawlten Seiten gefundenen Links in die Warteschlange ein. Sie können auch direkt auf eine sitemap.xml-Datei verweisen, indem Sie sie als weitere Start-URL hinzufügen, z. B. https://www.example.com/sitemap.xml.

Proxy-Region

Sie können einen Proxy auswählen, den der Crawler verwendet, wenn Sie benötigen, dass Ihre Website mit einem Proxy aus einer bestimmten Region oder einem bestimmten Land gecrawlt wird.

Wir unterstützen derzeit die folgenden Proxys:

  • Rotierend: United States, Germany, France, United Kingdom, Czechia, Hungary

  • Statisch:

    • United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • Australien - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

Crawler-Typ

Wählen Sie, wie gründlich der Crawler jede Seite rendert, während diese Website synchronisiert wird.

  • Wenn Seiten beim Synchronisieren leer oder abgeschnitten sind, liegt das normalerweise an JavaScript‑Rendering. Wechseln Sie zu Full und synchronisieren Sie erneut.

  • Full ist ressourcenintensiver, daher wird eine große Quelle eher seltener geplant.

  • Sie können dies bei einer bestehenden Quelle ändern und zum Vergleichen neu synchronisieren.

Option

Was es bewirkt

Wann verwenden

Schnell

Liest HTML, ohne JavaScript auszuführen.

Der Inhalt steckt im anfänglichen HTML — die meisten Blogs, Dokumentationen, help center.

Auto (Standard)

Wir wählen aus und schalten bei Bedarf auf Full, wenn die Seite JavaScript benötigt.

Sie sind sich nicht sicher. Für fast alle geeignet.

Full

Lädt jede Seite in einem Browser und führt JavaScript aus. Langsamer.

Inhalte erscheinen erst, nachdem Skripte ausgeführt wurden — Single‑Page‑Apps und JavaScript‑intensive Seiten.

Canonical‑URLs ignorieren

Wenn aktiviert, ignoriert der Web‑Scraper canonical‑Link‑Tags (rel="canonical") und behandelt jede URL als eigene Seite. Diese Option ist standardmäßig deaktiviert.

Das ist nützlich, wenn eine Seite viele URLs auf eine einzige kanonische URL zeigt und deshalb Inhalte verloren gehen.

Abfrageparameter ausschließen und robots.txt beachten

Unter Erweiterte Einstellungen gibt es zwei weitere Umschalter. Beide sind standardmäßig deaktiviert.

Respect robots.txt: sorgt dafür, dass der Crawler die Disallow‑Regeln in der robots.txt Ihrer Website befolgt. Schalten Sie es ein, um die Synchronisierung konsistent mit dem zu halten, was Sie anderen Crawlern erlauben. Wenn robots.txt Pfade ausschließt, die Inhalte enthalten, die Sie in Fin haben möchten, reduziert dies, was synchronisiert wird.

Exclude query parameters: überspringt jede URL mit einer Abfragezeichenfolge (?). Schalten Sie es ein, wenn Ihre Website Tracking-, Sitzungs- oder Sortierparameter anhängt, die viele nahezu identische Seiten erzeugen. Lassen Sie es aus, wenn sich echte Inhalte hinter einer Abfragezeichenfolge verbergen, z. B. /docs?page=intro — diese Seiten würden sonst ebenfalls übersprungen.

Zielgruppen

Der Target-Schritt ermöglicht es Ihnen, eine Standardzielgruppe für alle synchronisierten Seiten festzulegen und URL‑basierte Regeln zu erstellen, um anhand von URL‑M mustern automatisch bestimmte Zielgruppen zuzuweisen — keine manuelle Kennzeichnung erforderlich.

Entscheiden Sie zunächst, ob Inhalte aus dieser Quelle für Fin AI Agent und/oder Copilot aktiviert sind.

Anschließend können Sie entweder eine Standard‑Fin‑Zielgruppe für alle von dieser Quelle synchronisierten Seiten festlegen (wenn keine Standardgruppe gesetzt ist, ist der Inhalt standardmäßig für Everyone), oder Regeln erstellen, um bestimmte Zielgruppen basierend auf URL‑Mustern zuzuweisen.

Zum Beispiel: Wenn die URL /uk enthält, weisen Sie die UK‑Zielgruppe zu. Regeln werden während der Synchronisierung ausgewertet, sodass Fin und Copilot immer die richtigen Inhalte der richtigen Zielgruppe bereitstellen.

Jede Regel unterstützt drei URL‑Vergleichsarten:

  • Beginnt mit — stimmt mit URLs überein, die mit einem bestimmten Präfix beginnen.

  • Endet mit — stimmt mit URLs überein, die mit einem bestimmten Suffix enden.

  • Enthält — stimmt mit URLs überein, die eine bestimmte Teilzeichenfolge enthalten.

Hinweis:

  • Eine Live‑Vorschau zeigt, wie viele Seiten mit jeder Regel übereinstimmen, damit Sie Regeln vor dem Speichern validieren können. Dafür wird eine Sitemap für Ihre Web‑Sync‑Quelle benötigt. Ohne Sitemap gelten Regeln weiterhin, aber Sie können Übereinstimmungen nicht vorschauen.

  • Regeln werden bei Erstellung automatisch benannt, können aber umbenannt werden. Pro Web‑Sync‑Quelle gilt ein Maximum von 10 Regeln.

  • Zielgruppenregeln sind nur additives: sie fügen Zielgruppen zu Inhalten hinzu, entfernen aber niemals bestehende Zuordnungen. Das Entfernen einer Regel macht ihre bisherigen Zielgruppenzuordnungen nicht rückgängig.

Synchronisierungseinstellungen überprüfen

Überprüfen Sie abschließend Ihre Synchronisierungseinstellungen und klicken Sie dann auf Sync website , um die Inhalte Ihrer Website mit Intercom zu synchronisieren.


Website‑Quellen verwalten

Sobald die Synchronisierung abgeschlossen ist, erhalten Sie eine E‑Mail‑Benachrichtigung und die Website wird als synchronisierte Quelle unter Train > Content im Abschnitt "Content sources" angezeigt.

Wenn Sie in eine Website‑Quelle klicken, können Sie die einzelnen Seiten, die von der öffentlichen URL synchronisiert wurden, in der Vorschau anzeigen und verwalten.

Hinweis: Website‑Quellen sind schreibgeschützt und können nicht innerhalb Ihres Fin‑Arbeitsbereichs bearbeitet werden; sie müssen an der Quelle bearbeitet werden.

Einstellungen konfigurieren

Wenn Sie eine Webseite anzeigen, finden Sie ein „Details“-Panel auf der rechten Seite, das Folgendes enthält:

  • Daten: Zeigen Sie den Inhaltstyp, die Sprache, das Erstellungsdatum und das letzte Update (wann es zuletzt mit der Quelle synchronisiert wurde) an.

  • Fin: Aktivieren/deaktivieren für Fin Agent und Fin Copilot. Wenn aktiviert, wird der Inhalt für Kunden bzw. Teammitglieder verfügbar

    • Planung: Schalten Sie Inhalte für Fin und Copilot an oder aus zu festgelegten Daten.

    • Audience: Stellen Sie sicher, dass Kund:innen nur Antworten erhalten und Inhalte von Fin Agent sehen, die für sie relevant sind.

  • Link: Die öffentliche URL für diese Website-Quelle.

  • Reports: Verfolgt, wie oft dieser Inhalt genutzt wird, um Gespräche durch Fin Agent zu lösen.

  • Tag: Fügen Sie ein Tag hinzu, um Webseiten zu gruppieren und Inhalte organisiert zu halten.

Make it available to Fin or Copilot

Um eine Website-Quelle für Fin Agent oder Fin Copilot verfügbar zu machen, gehen Sie zu Train > Content und klicken Sie in der Sektion "Content sources" auf die Website-Quelle, öffnen Sie dann die entsprechende synchronisierte Webseite.

Vom "Details" Panel scrollen Sie nach unten zu „Fin“ und schalten Sie um:

  • Fin Agent - Diese Einstellung macht die Webseite für Fin AI verfügbar, damit sie beim Beantworten von Kund:innen verwendet wird (sie berücksichtigt alle Audience-Regeln).

  • Fin Copilot - Diese Einstellung macht die Webseite für Fin Copilot verfügbar, damit sie beim Beantworten von Teamkolleg:innen verwendet wird.

Website-Verfügbarkeit planen

Sie können planen, wann synchronisierte Webseiten für Fin und Copilot ein- oder ausgeschaltet werden, zu einem zukünftigen Datum, Zeitpunkt und in einer Zeitzone. Legen Sie nur ein Startdatum fest oder sowohl Start- als auch Enddatum, um ein zeitlich begrenztes Verfügbarkeitsfenster zu erstellen. Die Planung gilt für einzelne Seiten oder im Bulk.

Eine einzelne Seite planen

  1. Öffnen Sie die Seite. Finden Sie im rechten Details-Bereich den Abschnitt Scheduling innerhalb des Fin-Dropdowns.

  2. Klicken Sie auf Schedule availability.

  3. Im Modal: Wählen Sie das KI-Produkt (Fin for Service oder Fin Copilot), stellen Sie die Verfügbarkeit ein (Enable oder Disable) und wählen Sie Datum, Uhrzeit und Zeitzone.

  4. Optional können Sie Set end date umschalten, um ein Enddatum und eine Endzeit hinzuzufügen — die Aktion kehrt zu diesem Zeitpunkt automatisch um.

  5. Klicken Sie auf Schedule, um zu bestätigen.

Seiten im Bulk planen

  1. Wählen Sie mehrere Seiten aus der Inhaltsliste aus.

  2. Gehen Sie zum Dropdown More actions und wählen Sie Schedule availability.

  3. Dasselbe Planungs-Modal gilt für alle ausgewählten Elemente.

Wie die Planung funktioniert

  • Start date only: Die Aktivieren/Deaktivieren-Aktion tritt zur geplanten Zeit in Kraft und bleibt wirksam, bis Sie sie manuell ändern.

  • Start + end date: Inhalte werden zur Startzeit eingeschaltet (oder ausgeschaltet) und kehren dann automatisch zur Endzeit zurück.

  • Manuelle Änderungen stornierten keinen anstehenden Zeitplan: Wenn Sie die Verfügbarkeit nach dem Festlegen eines Zeitplans manuell umschalten, wird die geplante Änderung trotzdem zur geplanten Zeit ausgeführt und Ihre manuelle Änderung überschreiben.

  • Ein anstehender Zeitplan pro Element pro Agent: Das Festlegen eines neuen Zeitplans ersetzt den vorherigen — keine Duplikate.

  • Gelöschte Inhalte: Wenn eine Seite gelöscht wird, bevor ihr Zeitplan ausgeführt wird, gilt der Zeitplan einfach nicht und es wird kein Fehler angezeigt.

Für ein bestimmtes Publikum verfügbar machen

Sie können Zielgruppen synchronisierter Inhalte automatisch mit URL-basierten Regeln während der Erstellung der Web-Synchronisierung zuweisen oder manuell für jede Seite. Zuerst müssen Sie die Zielgruppe erstellen und definieren, die Sie ansprechen möchten: create and define the audience.

Gehen Sie dann zu Train > Content und klicken Sie in der Sektion "Content sources" auf die Website-Quelle, öffnen Sie dann die entsprechende synchronisierte Webseite.

Vom "Details" Panel scrollen Sie nach unten zu “Fin” und verwenden Sie das Audience-Dropdown, um eine Ihrer vordefinierten Zielgruppen auszuwählen.

Note:

  • Die Standardzielgruppe für öffentliche URLs ist „Everyone“.

  • Fin Agent wird auch jede auf eine öffentliche URL angewendete Zielgruppe respektieren und diesen Artikel nur zur Beantwortung von Kundenfragen verwenden, wenn sie den Zielgruppenkriterien entsprechen.

Zielgruppenregeln zu bestehenden Synchronisierungen hinzufügen oder bearbeiten

Sie müssen keine Synchronisierung neu erstellen, um Zielgruppenzielsetzung hinzuzufügen. Gehen Sie zu Train > Content, wählen Sie die Quelle, klicken Sie auf das Einstellungs-Dropdown oben rechts und wählen Sie Open settings. Navigieren Sie zum Schritt Target, um URL-basierte Regeln hinzuzufügen oder zu bearbeiten.

Note: Wenn Zielgruppenregeln zu einer bestehenden Web-Synchronisierung hinzugefügt werden, gelten sie rückwirkend für alle bereits von dieser Quelle aufgenommenen Inhalte — nicht nur für neue Inhalte.

Website als Quelle erneut synchronisieren oder entfernen

Wenn Sie eine öffentliche URL als Quelle erneut synchronisieren oder entfernen möchten, gehen Sie zu Train > Content und klicken Sie in der Sektion "Content sources" auf die Website-Quelle, öffnen Sie dann das Dropdown Settings oben rechts.

Hier können Sie auswählen, ob Sie Re-sync oder Remove this source. möchten.

Tip: Änderungen auf Ihrer Quell-Website erscheinen nicht sofort in Intercom. Website-Re-Syncs erfolgen automatisch jede Woche, aber Sie können jederzeit eine manuelle Re-Sync auslösen, um die neuesten Inhalte früher anzuzeigen.

Website-Synchronisierungsverlauf anzeigen

Sie können eine Liste vergangener Website-Synchronisierungen anzeigen, um zu sehen, wann sie zuletzt ausgeführt wurden, welche Seiten gefunden wurden und welche Seiten fehlgeschlagen sind. Gehen Sie zu Train > Content und klicken Sie in der Sektion "Content sources" auf die Website-Quelle, wählen Sie dann View sync history.


Jede Zeile in der Tabelle stellt einen vergangenen oder aktiven Lauf dar, und Sie können die Läufe nach status (started, success, failed) filtern.

Es enthält die folgenden Informationen:

  • Sync-Datum

  • Status

  • Synchronisierte Seiten

  • Ausgeschlossene Seiten

  • Fehlgeschlagene Seiten

  • Dauer

  • Sync gestartet von

Wenn ein Sync fehlgeschlagen ist, können Sie mit der Maus über den Status fahren, um eine detaillierte Erklärung des Grundes zu sehen.

Automatische Syncs pausieren, wenn Fin keine Website verwendet

Eine neue Quelle wird in den ersten 90 Tagen wie geplant synchronisiert. Danach bleibt die Synchronisierung automatisch aktiv, wenn eine der folgenden Bedingungen zutrifft:

  • Eine Seite davon wurde in den letzten 90 Tagen in einer Fin-Antwort verwendet.

Andernfalls werden geplante Syncs angehalten.

Wenn pausiert: Seiten bleiben in Ihrem Knowledge Hub und für Fin und Copilot verfügbar (es wird nichts gelöscht). Nur das erneute Crawlen stoppt, daher werden Änderungen auf Ihrer Website nicht übernommen.

Wiederherstellen: Die Schaltfläche Sync now aktualisiert den Inhalt einmal, startet den Zeitplan jedoch nicht neu. Die automatische Synchronisierung wird wieder aufgenommen, sobald Fin die Quelle erneut verwendet.

Websites, die schwer zu crawlen sind, synchronisieren seltener

Sehr große Sites und solche, die vollständiges JavaScript-Rendering benötigen, verursachen deutlich höhere Crawling-Kosten. Wenn eine Quelle ressourcenintensiv ist, verschieben wir sie von einem wöchentlichen auf einen 14-tägigen Zeitplan.

Dies geschieht automatisch pro Quelle. Um eine große Site auf einem schnelleren Zeitplan zu halten, schränken Sie den Crawl durch URL-Ausschlüsse ein oder fügen Sie spezifische Unterseiten statt einer gesamten domain hinzu.


Fehlerbehebung bei Website-Sync

Häufige Probleme

Beim Import von Website-Inhalten zur Aktivierung von Fin müssen Sie die öffentliche URL eingeben. Damit werden alle unter dieser URL verschachtelten Seiten gesucht und für den Fin AI Agent synchronisiert.

Wenn der Importer nicht die erwartete Seitenanzahl zurückgegeben hat, kann das verschiedene Gründe haben...

Die angegebene URL ist nicht die oberste domain

Der Website-Sync funktioniert, indem die von Ihnen angegebene URL aufgerufen und alle unter dieser URL verschachtelten Seiten durchsucht werden. Diese Seiten müssen dasselbe URL-Muster wie die von Ihnen angegebene URL haben.

Beispielsweise, wenn die oberste domain https://myhelpcenter.com/home ist, müssen alle zu importierenden Seiten das Präfix /home in der URL enthalten, z. B. https://myhelpcenter.com/home/article. Falls nicht, entfernen Sie das Präfix und verwenden Sie den grundlegendsten URL-Stamm, z. B. https://myhelpcenter.com, und versuchen Sie den Import erneut.

Die URL ist privat

Wenn die Inhalte, die Sie verwenden möchten, hinter einem Login liegen, kann Fin sie nicht zugreifen oder importieren.

Seitenlimits

Der Website-Sync hat zwei Beschränkungen:

  • Domains: Sie können bis zu 100 verschiedene Top-Level-Domains synchronisieren.

  • Pages per source: Fin synchronisiert maximal 4.000 Seiten pro Quelle.

Ein Sync kann auch fehlschlagen, wenn eine einzelne Seite eine sehr große Menge an Inhalten enthält. Sie werden per E-Mail benachrichtigt, wenn ein Sync fehlschlägt.

Hinweis:

  • Wenn eine Quelle mehr als 4.000 Seiten hat, teilen Sie sie in mehrere Quellen auf, damit jede unter dem Limit bleibt:

    • Teilen Sie die Site in kleinere Abschnitte und fügen Sie jeden Abschnitt als eigene Quelle hinzu.

    • Synchronisieren Sie verschiedene URL-Pfade getrennt, z. B. eine Quelle pro Produktbereich oder Kategorie.

  • Dies hält jede Quelle unter dem Seitenlimit und verringert die pro Sync verarbeiteten Inhalte.

Websites, die auf bestimmte regionale IPs beschränkt sind

Fin's Website-Sync (verwendet, um öffentliche URLs für Fin AI Agent und Copilot hinzuzufügen) verwendet derzeit keinen dedizierten, benutzerdefinierten User-Agent-String.

Wenn Ihre Site strenge Anti-Crawling-Schutzmaßnahmen hat, können Sie einen static proxy verwenden, um eine feste IP-Adresse auf die Allow-Liste zu setzen und sicherzustellen, dass Ihre Inhalte ingested werden. Wählen Sie beim Erstellen oder Bearbeiten Ihres Website-Sync unter Advanced settings einen static proxy aus.

  • Per IP-Adresse: Wenn Ihre Site Allow-Listing erfordert, wählen Sie unter Advanced settings einen static proxy — dies gibt Ihnen eine feste IP-Liste, die Sie Ihrer Allow-Liste hinzufügen können.

  • Diese Anfragen werden nur für die Website-Synchronisierung verwendet. Sie beeinflussen nicht Ihren Messenger-Verkehr oder das Endbenutzer-Tracking.

Seiten von nicht-englischen oder internationalen Sites werden nicht synchronisiert

Wenn Ihre Sitemap URLs mit nicht-ASCII-Zeichen (z. B. Akzentbuchstaben oder Skripten wie Chinesisch oder Arabisch) enthält, werden einige dieser Seiten möglicherweise nicht wie erwartet synchronisiert. Die Sitemap-Erkennung unterstützt diese URLs jetzt, aber sie können in anderen Teilen des Sync-Prozesses weiterhin Probleme verursachen. Versuchen Sie, manuell erneut zu synchronisieren. Wenn Seiten weiterhin fehlen, kontaktieren Sie den Support.

Website-Sync-Fehler

Wenn Sie Website-Inhalte synchronisieren, können unterschiedliche Status angezeigt werden, die zeigen, was während des Prozesses passiert ist. Um Ihren Website-Sync-Status zu sehen, gehen Sie zu Train > Content und wählen Sie die Website-Quelle, dann verwenden Sie das Status Dropdown, um zu filtern nach:

  • Synchronisieren

  • Live

  • Fehlgeschlagen

  • Ausgeschlossen

Hier ist, was jeder bedeutet und was Sie als Nächstes tun können:

Synchronisieren

Der Seiten-Sync ist noch im Gange. Ein initialer Sync kann je nach Inhalt von einigen Minuten bis über eine Stunde dauern.

Live

Die Seite wurde erfolgreich synchronisiert und kann für Fin und Copilot aktiviert werden.

Hinweis: Ein erfolgreicher Sync bedeutet nicht immer, dass wir allen Inhalt der Seite erfassen konnten. Wenn Sie die vollständige Abdeckung bestätigen möchten, empfehlen wir, Fin mit Antworten zu vorschauen, die Sie erwarten, dass sie von dieser Seite gefunden werden.

Ausgeschlossen

Diese Seiten werden absichtlich nicht synchronisiert, weil Sie sie in den Advanced sync settings ausgeschlossen haben. Sie können nicht erneut versucht oder eingeschlossen werden, es sei denn, dies wird anders angegeben.

Fehlgeschlagen

Diese Fehler bedeuten, dass die Synchronisierung nicht abgeschlossen wurde und möglicherweise Änderungen auf Ihrer Seite erforderlich sind, bevor Sie es erneut versuchen können:

1. Unbekannter Fehler

  • Nachricht: „Auf diese Seite konnte nicht zugegriffen werden. Sie ist möglicherweise langsam oder blockiert. Versuchen Sie erneut zu synchronisieren oder kontaktieren Sie den Support, wenn es weiterhin fehlschlägt.“

  • Was das bedeutet: Etwas hat uns daran gehindert, auf die Seite zuzugreifen, aber die Ursache ist nicht klar.

2. Sitzung blockiert / Rate-Limit überschritten

  • Nachricht: „Die Website verhindert, dass wir auf ihre Inhalte zugreifen. Prüfen Sie, ob sie durch eine Anti-Crawler-Einstellung oder Firewall blockiert wird. Überprüfen Sie Ihre Site-Konfiguration und versuchen Sie erneut zu synchronisieren. Wenn das Problem weiterhin besteht, kontaktieren Sie den Support.“

  • Was das bedeutet: Ihre Website blockiert oder begrenzt unseren Crawler aktiv.

3. Netzwerk-, Timeout- oder ähnliche Fehler

  • Nachricht: „Auf diese Seite konnte nicht zugegriffen werden. Sie ist möglicherweise langsam beim Laden oder wird durch Anti-Crawler-Einstellungen oder eine Firewall blockiert. Überprüfen Sie Ihre Site-Konfiguration und versuchen Sie erneut zu synchronisieren. Wenn das Problem weiterhin besteht, kontaktieren Sie den Support.“

  • Was das bedeutet: Die Seite wurde nicht rechtzeitig geladen oder konnte aufgrund von Netzwerkproblemen oder Blockierungen nicht erreicht werden.

4. Duplikat

  • Nachricht: „Diese Seite hat denselben Inhalt wie eine andere, die bereits synchronisiert wurde. Es wird nur eine Version eingeschlossen.“

  • Was das bedeutet: Wir haben identische Inhalte an anderer Stelle festgestellt, daher wird nur eine Kopie behalten.

5. Schlüsselwort-Filterung

  • Nachricht: „Seiten mit Schlüsselwörtern wie category, collection oder tag in der URL werden standardmäßig ausgeschlossen, da sie normalerweise keine einzigartigen Inhalte enthalten. Wenn diese Seite eingeschlossen werden soll, kontaktieren Sie den Support.“

  • Was das bedeutet: Diese URLs stellen oft Listen dar, keine eigenständigen Inhaltsseiten.

6. Statuscode 400

  • Nachricht: „Seiteninhalt kann nicht gefunden werden. Überprüfen Sie, ob die URL gültig ist und die Seite ohne Probleme geladen wird.“

  • Was das bedeutet: Die URL ist möglicherweise defekt oder liefert auf Ihrer Website einen Fehler.

7. Blockierte URL

  • Nachricht: „Diese Website domain ist vom Synchronisieren blockiert. Wenn Sie dies benötigen, kontaktieren Sie den Support.“

  • Was das bedeutet: Die domain ist bewusst vom Synchronisieren ausgeschlossen.


​Sie können eine fehlgeschlagene Seiten-Synchronisierung erneut versuchen, indem Sie mit der Maus über die Seite fahren, das Drei-Punkte-Menü auswählen und dann Resync.

Hat dies deine Frage beantwortet?