Si vous souhaitez entraîner Fin avec le contenu d’un site web, vous pouvez le faire en synchronisant l’URL publique de ce site.
Commencer
Accédez à Train > Content puis sélectionnez Website sync sous la section « Add content ».
Saisissez maintenant l’URL publique de votre site (top-level domain) et cliquez sur Next.
This will fetch all of the pages from the website URL you provide and will read from all the sub domain pages.
Tips:
Provide your external help center homepage link for best results.
Use top-level domains (e.g. https://myhelpcenter.com rather than https://myhelpcenter.com/articles).
Review pages to sync
Once you input your URL, we will check that it's valid and accessible. Then you'll need to review the pages to sync. All sub-pages linked in each selected section will be synced. Select only relevant up-to-date content.
Tips:
Select pages and sections that contain support content like help articles, guides, or FAQS.
Avoid selecting marketing pages, product listings, or pages with complex layouts.
All linked sub-pages within selected sections will be automatically included.
You can always update your selection later in the advanced settings.
Advanced settings [optional]
Select the Advanced settings dropdown to configure additional URLs, exclude URLs, CSS selectors to exclude, and more.
Additional URLs
Website structures can vary. To make sure that we sync your most relevant content, we recommend you add additional URLs for those specific subpages.
For example, if you input https://myhelpcenter.com/help as the primary URL above, you might also want to add the specific URL like https://myhelpcenter.com/help/index.html
URLs to exclude
To exclude certain pages you don’t want to sync content from, you can add a list of URL globs.
What is a URL glob?
A glob is a string of literal and/or wildcard characters used to match file paths or URLs. Globbing is the act of locating files on a filesystem using one or more globs. Using URL globs also helps to get a range of URLs that are mostly the same, with only a small portion of it changing between the requests.
For example, this URL glob https://{store,docs}.example.com/** lets the crawler access all URLs starting with https://store.example.com/ or https://docs.example.com/ and https://example.com/**/*\?*foo=*
Tip: Not sure if your glob pattern will match the URLs you want to exclude? You can use DigitalOcean's Glob Tool to test patterns against sample URLs before applying them. (This is a third-party tool not maintained by Intercom.)
CSS selectors to exclude
To exclude certain page elements, you can use CSS selectors of those specific sections or elements you want to exclude.
This is useful to skip irrelevant page content. The value must be a valid CSS selector as accepted by the document.querySelectorAll() function. By default, we already remove common navigation elements, headers, footers, modals, scripts, and inline images.
Clickable CSS selector
This allows for DOM elements identified by the CSS selector, to be clicked during the web sync process.
This is useful for expanding collapsed sections, in order to capture their text content. The value must be a valid CSS selector as accepted by the document.querySelectorAll() function.
Examples are "[aria-expanded=\"false\"]", #expand_section
Complex conditions can be also described with a CSS selector. In CSS, chaining the selectors without spaces creates an AND-like condition, for example .button.blue.small will match only elements with all three classes.
Using comma (,) as a separator works like OR, for example .button, .blue, h1 targets all elements with class button, or class blue, or first-level headings.
Wait to load CSS selector
To target content that may have a delay in appearing on the page, you can add a CSS selector that will make the web scraper wait before scraping content.
This is useful for pages for which the default content load recognition by idle network fails. Setting this option completely disables the default behavior, and the page will be processed only if the element specified by this selector appears.
Note: The value must be a valid CSS selector as accepted by the document.querySelectorAll() function.
XML Sitemap
Enable XML Sitemap for a more robust websync on sitemap-supported websites, allowing access to pages that might not be reachable from the initial URLs.
If this option is enabled, the web scraper will look for Sitemaps at the domains of the provided source URL and enqueue matching URLs similarly as the links found on crawled pages. You can also reference a sitemap.xml file directly by adding it as another Start URL e.g. https://www.example.com/sitemap.xml.
Proxy region
You can select a proxy for crawler to use if you require your website to be crawled with a proxy set to a specific region or country.
We currently support the following proxies:
Rotating: United States, Germany, France, United Kingdom, Czechia, Hungary
Static:
United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europe - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Australia - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Type de robot d'exploration
Choisissez à quel point le robot rend chaque page lors de la synchronisation de ce site.
Pages synchronisées vides ou tronquées signifient généralement un rendu JavaScript. Passez à Full et re-synchronisez.
Full est plus lourd, il est donc plus susceptible de placer une source volumineuse sur un calendrier réduit.
Vous pouvez modifier cela sur une source existante et resynchroniser pour comparer.
Option | Ce que cela fait | Utilisez-le lorsque |
Fast | Lit le HTML sans exécuter JavaScript. | Le contenu est dans le HTML initial — la plupart des blogs, docs, help centers. |
Auto (par défaut) | Nous choisissons, et passons à Full si le site nécessite JavaScript. | Vous n'êtes pas sûr. Convient à presque tout le monde. |
Full | Charge chaque page dans un navigateur et exécute JavaScript. Plus lent. | Le contenu n'apparaît qu'après l'exécution des scripts, applications monopage pages lourdes en JavaScript. |
Ignorer les URL canoniques
Lorsqu'il est activé, le scraper web ignore les balises link canonical (rel="canonical") et traite chaque URL comme une page distincte. Cette option est désactivée par défaut.
Ceci est utile lorsqu'un site pointe de nombreuses pages vers une URL canonique unique et que du contenu est manqué en conséquence.
Exclusion des paramètres de requête et respect de robots.txt
Il y a deux bascules supplémentaires sous Advanced settings. Les deux sont désactivées par défaut.
Respect robots.txt : fait en sorte que le robot respecte les règles disallow de robots.txt de votre site. Activez-le pour garder la synchronisation cohérente avec ce que vous autorisez aux autres robots d'atteindre. Si robots.txt interdit des chemins contenant du contenu que vous souhaitez dans Fin, cela réduira ce qui est synchronisé.
Exclude query parameters : ignore toute URL avec une chaîne de requête (?). Activez-le lorsque votre site ajoute des paramètres de suivi, de session ou de tri produisant de nombreuses pages presque dupliquées. Laissez-le désactivé si un vrai contenu se trouve derrière une chaîne de requête, comme /docs?page=intro — ces pages seraient également ignorées.
Publics cibles
L'étape Target vous permet de définir un public par défaut pour toutes les pages synchronisées et de créer des règles basées sur l'URL pour attribuer automatiquement des publics spécifiques selon des modèles d'URL — pas d'étiquetage manuel requis.
Décidez d'abord si le contenu de cette source est activé pour Fin AI Agent et/ou Copilot.
Ensuite, vous pouvez soit définir un public Fin par défaut à appliquer à toutes les pages synchronisées depuis cette source (si aucun par défaut n'est défini, le contenu par défaut est Everyone), soit créer des règles pour attribuer des publics spécifiques selon des modèles d'URL.
Par exemple : Si l'URL contient /uk, attribuez le public UK. Les règles sont évaluées pendant la synchronisation, donc Fin et Copilot servent toujours le bon contenu au bon public.
Chaque règle prend en charge trois comparateurs d'URL :
Starts with — correspond aux URL commençant par un préfixe donné.
Ends with — correspond aux URL se terminant par un suffixe donné.
Contains — correspond aux URL contenant une sous-chaîne donnée.
Note :
Un aperçu en direct montre combien de pages correspondent à chaque règle, vous aidant à valider les règles avant d'enregistrer. Cela nécessite qu'un sitemap soit disponible pour votre source de synchronisation web. Sans sitemap, les règles s'appliquent toujours mais vous ne pouvez pas prévisualiser les correspondances.
Les règles sont renommées automatiquement à la création mais peuvent être renommées. Un maximum de 10 règles par source de synchronisation web est appliqué.
Les règles d'audience ne font qu'ajouter : elles ajoutent des audiences au contenu mais ne retirent jamais les attributions existantes. La suppression d'une règle n'annule pas ses attributions d'audience passées.
Revoir les paramètres de synchronisation
Enfin, passez en revue vos paramètres de synchronisation puis cliquez sur Sync website pour commencer à synchroniser le contenu de votre site avec Intercom.
Gérer les sources de sites web
Une fois la synchronisation terminée, vous recevrez une notification par e-mail et le site apparaîtra comme une source synchronisée dans Train > Content sous la section "Content sources".
Si vous cliquez sur une source de site web, vous pouvez prévisualiser et gérer les pages individuelles synchronisées depuis l'URL publique.
Note : Les sources de sites web sont en lecture seule et ne peuvent pas être modifiées dans votre espace de travail Fin, elles doivent être modifiées à la source.
Configurer les paramètres
Lorsque vous affichez une page de site web, vous trouverez un panneau "Détails" à droite qui contient :
Data : Voir le type de contenu, la langue, la date de création et la dernière mise à jour (lorsqu'elle a été synchronisée pour la dernière fois avec la source).
Fin: Enable/disable for Fin Agent and Fin Copilot. When enabled, the content becomes available to customers and teammates, respectively
Scheduling: Turn content on or off for Fin and Copilot on set dates.
Audience: Assurez-vous que les clients ne reçoivent que des réponses et ne voient que le contenu de Fin Agent qui leur est pertinent.
Link: L’URL publique de cette source de site web.
Reports : Suit la fréquence à laquelle ce contenu est utilisé pour résoudre des conversations par Fin Agent.
Tag: Ajoutez une étiquette pour regrouper les pages web et garder le contenu organisé.
Rendez-le disponible pour Fin ou Copilot
Pour rendre une source de site web disponible pour Fin Agent ou Fin Copilot, allez dans Train > Content et cliquez sur la source du site sous la section « Content sources », puis ouvrez la page web pertinente que vous avez synchronisée.
Depuis le panneau « Details » faites défiler jusqu’à “Fin” et activez le bouton :
Fin Agent - Ce paramètre rendra la page web disponible pour que Fin AI l’utilise lorsqu’il répond aux clients (il respectera les règles d’audience).
Fin Copilot - Ce paramètre rendra la page web disponible pour que Fin Copilot l’utilise lorsqu’il répond aux collègues.
Planifier la disponibilité d’un site web
Vous pouvez planifier quand les pages de site synchronisées s’activent ou se désactivent pour Fin et Copilot, à une date, heure et fuseau horaire futurs. Définissez uniquement une date de début, ou définissez à la fois une date de début et de fin pour créer une fenêtre de disponibilité limitée dans le temps. La planification s’applique aux pages individuelles ou en masse.
Planifier une page unique
Ouvrez la page. Dans le panneau Détails à droite, trouvez la section Scheduling dans le menu déroulant Fin.
Cliquez sur Schedule availability.
Dans la fenêtre modale : sélectionnez le produit IA (Fin for Service ou Fin Copilot), définissez la disponibilité (Enable ou Disable), et choisissez une date, une heure et un fuseau horaire.
Optionnellement, activez Set end date pour ajouter une date et une heure de fin — l’action se révertira automatiquement à ce moment-là.
Cliquez sur Schedule pour confirmer.
Planifier des pages en masse
Sélectionnez plusieurs pages dans la liste de contenu.
Allez dans le menu déroulant More actions et sélectionnez Schedule availability.
La même fenêtre de planification s’applique à tous les éléments sélectionnés.
Comment fonctionne la planification
Start date only: L’action d’activation/désactivation se déclenche à l’heure prévue et reste en vigueur jusqu’à ce que vous la modifiiez manuellement.
Start + end date: Le contenu s’active (ou se désactive) à l’heure de début, puis revient automatiquement à l’heure de fin.
Manual changes don't cancel a pending schedule: Si vous basculez manuellement la disponibilité après avoir défini une planification, la transition programmée s’exécutera toujours à l’heure prévue et remplacera votre modification manuelle.
One pending schedule per item per agent: La définition d’une nouvelle planification remplace la précédente — pas de doublons.
Deleted content: Si une page est supprimée avant que sa planification ne s’exécute, la planification ne s’appliquera tout simplement pas et aucune erreur ne sera affichée.
Rendez-le disponible à un public spécifique
Vous pouvez attribuer des audiences au contenu synchronisé automatiquement en utilisant des règles basées sur l’URL lors de la création de la synchronisation web, ou manuellement page par page. D’abord, vous devez créer et définir l’audience que vous souhaitez cibler.
Ensuite, allez dans Train > Content et cliquez sur la source du site sous la section « Content sources », puis ouvrez la page web pertinente que vous avez synchronisée.
Depuis le panneau « Details » faites défiler jusqu’à “Fin” et utilisez le menu déroulant d’audience pour sélectionner l’une de vos audiences pré-définies.
Note:
L’audience par défaut pour les URL publiques est « Everyone ».
Fin Agent respectera également toute audience que vous appliquez à une URL publique et n’utilisera cet article pour répondre aux questions des clients que si elles correspondent aux règles d’audience.
Ajouter ou modifier des règles d’audience sur des synchronisations existantes
Vous n’avez pas besoin de recréer une synchronisation pour ajouter le ciblage d’audience. Allez dans Train > Content, sélectionnez la source, cliquez sur le menu Paramètres en haut à droite, et sélectionnez Open settings. Naviguez jusqu’à l’étape Target pour ajouter ou modifier les règles basées sur l’URL.
Note: Lorsque des règles d’audience sont ajoutées à une synchronisation web existante, elles s’appliquent rétroactivement à tout le contenu déjà ingéré depuis cette source — pas seulement au nouveau contenu à venir.
Re-synchroniser ou supprimer un site en tant que source
Si vous souhaitez re-synchroniser ou supprimer une URL publique en tant que source, allez dans Train > Content, et cliquez sur la source du site sous la section "Content sources", puis ouvrez le menu Settings en haut à droite.
Ici, vous pouvez choisir de Re-sync ou Remove this source.
Tip: Les modifications apportées à votre site source n’apparaîtront pas immédiatement dans Intercom. Les re-synchronisations de site web ont lieu automatiquement chaque semaine, mais vous pouvez déclencher une re-synchronisation manuelle à tout moment pour afficher le contenu le plus récent plus tôt.
Afficher l’historique des synchronisations de site web
Vous pouvez afficher la liste des synchronisations passées pour voir quand elles ont été exécutées pour la dernière fois, quelles pages ont été trouvées et quelles pages ont échoué. Allez dans Train > Content, et cliquez sur la source du site sous la section "Content sources", puis sélectionnez View sync history.
Chaque ligne du tableau représente une exécution passée ou active, et vous pouvez filtrer les exécutions par status (started, success, failed).
Il inclut les informations suivantes :
Date de synchronisation
Statut
Pages synchronisées
Pages exclues
Pages échouées
Durée
Synchronisation lancée par
Si une synchronisation a échoué, vous pouvez passer la souris sur le statut pour voir une explication détaillée du motif.
Les synchronisations automatiques sont en pause lorsque Fin n'utilise pas un site web
Une nouvelle source se synchronise selon le calendrier pendant ses 90 premiers jours quoi qu'il arrive. Après cela, elle continue de se synchroniser automatiquement si l'une des conditions suivantes est vraie :
Une page provenant de celle-ci a été utilisée dans une réponse Fin au cours des 90 derniers jours.
Sinon, les synchronisations planifiées sont mises en pause.
Lorsque en pause : les pages restent dans votre Knowledge Hub et restent accessibles par Fin et Copilot (rien n'est supprimé). Seul le recrawl s'arrête, donc les modifications sur votre site ne seront pas prises en compte.
Pour la restaurer : Le bouton Sync now actualise le contenu une fois mais ne redémarre pas le calendrier. La synchronisation automatique reprend d'elle-même dès que Fin utilise de nouveau la source.
Les sites web lourds à explorer se synchronisent moins souvent
Les sites très volumineux et ceux nécessitant un rendu JavaScript complet coûtent bien plus cher à crawler. Lorsqu'une source s'avère gourmande en ressources, nous la passons d'un calendrier hebdomadaire à un rythme tous les 14 jours.
Cela se produit automatiquement, par source. Pour maintenir un grand site sur un calendrier plus rapide, restreignez le crawl en utilisant des exclusions d'URL, ou ajoutez des sous-pages spécifiques au lieu de tout le domain.
Dépannage de la synchronisation de site web
Problèmes courants
Lorsque vous importez du contenu de site web pour activer Fin, vous devez saisir l'URL publique. Cela recherchera toutes les pages incluses sous cette URL et les synchronisera pour que Fin AI Agent puisse les utiliser.
Si l'importateur n'a pas retourné le nombre de pages attendu, plusieurs raisons peuvent expliquer cela...
L'URL fournie n'est pas le top level domain
La synchronisation du site web fonctionne en allant à l'URL que vous fournissez, puis en recherchant toutes les pages incluses sous cette URL. Ces pages doivent avoir le même modèle d'URL que l'URL fournie.
Par exemple, si le top level domain est https://myhelpcenter.com/home, alors toutes les pages que vous souhaitez importer doivent inclure le préfixe /home dans l'URL, par ex. https://myhelpcenter.com/home/article. Si ce n'est pas le cas, retirez le préfixe et utilisez la racine d'URL la plus basique, par ex. https://myhelpcenter.com, puis réessayez l'importation.
L'URL est privée
Si le contenu que vous souhaitez utiliser est derrière un identifiant, Fin ne pourra pas y accéder ni l'importer.
Limites de pages
La synchronisation de site web a deux limites :
Domains: vous pouvez synchroniser jusqu'à 100 top-level domains différents.
Pages par source: Fin synchronise un maximum de 4 000 pages depuis chaque source.
Une synchronisation peut également échouer si une seule page contient une quantité très importante de contenu. Vous recevrez une notification par e-mail chaque fois qu'une synchronisation échoue.
Remarque :
Si une source contient plus de 4 000 pages, divisez-la en plusieurs sources pour que chacune reste en dessous de la limite :
Partitionnez le site en sections plus petites et ajoutez chaque section en tant que source distincte.
Synchronisez séparément différents chemins d'URL, par exemple une source par zone produit ou catégorie.
Cela maintient chaque source sous la limite de pages et réduit le contenu traité par synchronisation.
Sites web restreints à des IP régionales spécifiques
La synchronisation de site web de Fin (utilisée pour ajouter des URL publiques pour Fin AI Agent et Copilot) n'utilise pas de chaîne user-agent dédiée et personnalisée pour le moment.
Si votre site dispose d'une protection anti-crawling stricte, vous pouvez utiliser un static proxy pour ajouter en liste blanche un ensemble fixe d'adresses IP et garantir l'ingestion de votre contenu. Sélectionnez un static proxy dans Advanced settings lors de la création ou de la modification de votre synchronisation de site web.
Par adresse IP : Si votre site exige une mise en liste blanche, sélectionnez un static proxy dans Advanced settings — cela vous fournit un ensemble fixe d'IPs à ajouter à votre liste d'autorisation.
Ces requêtes sont utilisées uniquement pour la synchronisation de sites web. Elles n'affectent pas votre trafic Messenger ni le suivi des utilisateurs finaux.
Les pages de sites non anglophones ou internationaux ne se synchronisent pas
Si votre sitemap inclut des URLs avec des caractères non ASCII (comme des lettres accentuées, ou des écritures comme le chinois ou l'arabe), certaines de ces pages peuvent ne pas se synchroniser comme prévu. La découverte de sitemap prend désormais en charge ces URLs, mais elles peuvent toujours rencontrer des problèmes dans d'autres parties du processus de synchronisation. Essayez de resynchroniser manuellement pour résoudre le problème. Si des pages manquent toujours, contactez le support.
Erreurs de synchronisation de site web
Lorsque vous synchronisez du contenu de site web, vous pouvez voir différents statuts indiquant ce qui s'est passé pendant le processus. Pour voir le statut de synchronisation de votre site web, accédez à Train > Content et sélectionnez la source de site web, puis utilisez le menu déroulant Status pour filtrer par :
En cours de synchronisation
En ligne
Échoué
Exclu
Voici ce que chacun signifie et ce que vous pouvez faire ensuite :
En cours de synchronisation
La synchronisation des pages est toujours en cours. Une synchronisation initiale peut prendre de quelques minutes à plus d'une heure selon la quantité de contenu que vous avez.
En ligne
La page a été synchronisée avec succès et peut être activée pour Fin et Copilot.
Note: Une synchronisation réussie ne signifie pas toujours que nous avons pu extraire tout le contenu de la page. Si vous voulez confirmer la couverture complète, nous recommandons de prévisualiser Fin avec des réponses que vous attendez qu'il trouve sur cette page.
Exclu
Ces pages ne sont pas synchronisées intentionnellement parce que vous les avez exclues dans les Advanced sync settings. Elles ne peuvent pas être retentées ou incluses sauf indication contraire.
Échec
Ces erreurs signifient que la synchronisation n’a pas été complétée et peuvent nécessiter des modifications de votre part avant de réessayer :
1. Erreur inconnue
Message : « Cette page n’a pas pu être accédée. Elle peut être lente ou bloquée. Réessayez la synchronisation, ou contactez le support si cela échoue. »
Ce que cela signifie : Quelque chose nous a empêchés d’accéder à la page, mais la cause n’est pas claire.
2. Session bloquée / Limite de requêtes
Message : « Le site web nous empêche d’accéder à son contenu. Vérifiez s’il est bloqué par un paramètre anti-crawler ou un pare-feu. Vérifiez la configuration de votre site et réessayez la synchronisation. Si le problème persiste, contactez le support. »
Ce que cela signifie : Votre site bloque ou limite activement notre crawler.
3. Erreurs réseau, de délai d’attente ou similaires
Message : « Cette page n’a pas pu être accédée. Elle peut être longue à charger ou bloquée par des paramètres anti-crawler ou un pare-feu. Vérifiez la configuration de votre site et réessayez la synchronisation. Si le problème persiste, contactez le support. »
Ce que cela signifie : La page ne s’est pas chargée à temps ou n’a pas pu être atteinte en raison de problèmes réseau ou de blocage.
Que faire : Une erreur « Navigation timeout » est souvent causée par une protection contre les bots ou un logiciel de sécurité sur votre site bloquant le crawler d’Intercom. Pour résoudre cela, ajoutez en liste blanche les static proxy IP addresses listés dans la section Advanced settings ci‑dessus, puis sélectionnez la région de proxy correspondante sous Advanced settings lors de la création ou de la modification de la synchronisation de votre site, et réessayez la synchronisation.
4. Dupliqué
Message : « Cette page contient le même contenu qu’une autre déjà synchronisée. Une seule version sera incluse. »
Ce que cela signifie : Nous avons détecté du contenu identique ailleurs, donc une seule copie est conservée.
5. Filtrage par mot‑clé
Message : « Les pages avec des mots‑clés comme category, collection ou tag dans l’URL sont exclues par défaut, car elles ne contiennent généralement pas de contenu unique. Si cette page doit être incluse, contactez le support. »
Ce que cela signifie : Ces URL représentent souvent des listes, pas des pages de contenu indépendantes.
6. Code de statut 400
Message : « Le contenu de la page est introuvable. Vérifiez que l’URL est valide et que la page se charge sans problème. »
Ce que cela signifie : L’URL peut être cassée ou renvoyer une erreur sur votre site.
7. URL bloquée
Message : « Ce domain est bloqué et ne peut pas être synchronisé. Si vous en avez besoin, contactez le support. »
Ce que cela signifie : Le domain est intentionnellement exclu de la synchronisation.
Vous pouvez retenter la synchronisation d’une page échouée en passant la souris sur la page, en sélectionnant le menu à trois points puis en sélectionnant Resync.






















