Si deseas entrenar a Fin con el contenido del sitio web, puedes hacerlo sincronizando la URL pública de ese sitio.
Comenzar
Ve a Train > Content y luego selecciona Website sync debajo de la sección "Add content".
Ahora introduce la URL pública de tu sitio web (top-level domain) y haz clic en Siguiente.
Esto obtendrá todas las páginas de la URL del sitio web que proporciones y leerá todas las páginas de sub domain.
Consejos:
Proporciona el enlace a la página principal de tu external help center para obtener mejores resultados.
Usa top-level domains (p. ej. https://myhelpcenter.com en lugar de https://myhelpcenter.com/articles).
Revisar páginas para sincronizar
Una vez que ingreses tu URL, comprobaremos que sea válida y accesible. Luego necesitarás revisar las páginas para sincronizar. Todas las subpáginas vinculadas en cada sección seleccionada se sincronizarán. Selecciona solo contenido relevante y actualizado.
Consejos:
Selecciona páginas y secciones que contengan contenido de soporte como artículos de ayuda, guías o FAQS.
Evita seleccionar páginas de marketing, listados de productos o páginas con diseños complejos.
Todas las subpáginas vinculadas dentro de las secciones seleccionadas se incluirán automáticamente.
Siempre puedes actualizar tu selección más tarde en la configuración avanzada.
Configuración avanzada [opcional]
Selecciona el desplegable de Advanced settings para configurar URLs adicionales, excluir URLs, selectores CSS a excluir y más.
URLs adicionales
Las estructuras de los sitios web pueden variar. Para asegurarte de que sincronizamos tu contenido más relevante, te recomendamos que agregues URLs adicionales para esas subpáginas específicas.
Por ejemplo, si ingresas https://myhelpcenter.com/help como la URL principal arriba, también podrías querer agregar la URL específica como https://myhelpcenter.com/help/index.html
URLs para excluir
Para excluir ciertas páginas de las que no deseas sincronizar contenido, puedes agregar una lista de globs de URL.
¿Qué es un glob de URL?
Un glob es una cadena de caracteres literales y/o comodines usada para coincidir con rutas de archivos o URLs. Globbing es el acto de localizar archivos en un sistema de archivos usando uno o más globs. Usar globs de URL también ayuda a obtener un rango de URLs que son mayormente iguales, con solo una pequeña porción que cambia entre las solicitudes.
Por ejemplo, este URL glob https://{store,docs}.example.com/** permite al rastreador acceder a todas las URLs que comiencen con https://store.example.com/ o https://docs.example.com/ y https://example.com/**/*\?*foo=*
Consejo: ¿No estás seguro de si tu patrón glob coincidirá con las URLs que deseas excluir? Puedes usar la Herramienta Glob de DigitalOcean para probar patrones contra URLs de ejemplo antes de aplicarlos. (Esta es una herramienta de terceros no mantenida por Intercom.)
Selectores CSS para excluir
Para excluir ciertos elementos de la página, puedes usar selectores CSS de esas secciones o elementos específicos que deseas excluir.
Esto es útil para omitir contenido irrelevante de la página. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll(). Por defecto, ya eliminamos elementos comunes de navegación, encabezados, pies de página, modales, scripts e imágenes en línea.
Selector CSS clicable
Esto permite que elementos del DOM identificados por el selector CSS sean clicados durante el proceso de sincronización web.
Esto es útil para expandir secciones colapsadas, a fin de capturar su contenido de texto. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Los ejemplos son "[aria-expanded=\"false\"]", #expand_section
También se pueden describir condiciones complejas con un selector CSS. En CSS, encadenar selectores sin espacios crea una condición tipo AND, por ejemplo .button.blue.small coincidirá solo con elementos que tengan las tres clases.
Usar coma (,) como separador funciona como OR, por ejemplo .button, .blue, h1 apunta a todos los elementos con la clase button, o la clase blue, o encabezados de primer nivel.
Esperar para cargar selector CSS
Para dirigirte a contenido que puede tardar en aparecer en la página, puedes agregar un selector CSS que haga que el scraper web espere antes de extraer el contenido.
Esto es útil para páginas para las cuales el reconocimiento predeterminado de carga de contenido por inactividad de red falla. Configurar esta opción desactiva completamente el comportamiento predeterminado, y la página se procesará solo si aparece el elemento especificado por este selector.
Nota: El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Mapa del sitio XML
Habilita el Mapa del sitio XML para una sincronización web más robusta en sitios que admiten sitemaps, permitiendo el acceso a páginas que podrían no ser alcanzables desde las URLs iniciales.
Si esta opción está habilitada, el scraper web buscará Sitemaps en los dominios de la URL de origen proporcionada y encolará URLs coincidentes de forma similar a los enlaces encontrados en las páginas rastreadas. También puedes hacer referencia a un archivo sitemap.xml directamente agregándolo como otra URL de inicio, por ejemplo https://www.example.com/sitemap.xml.
Región del proxy
Puedes seleccionar un proxy para que lo use el rastreador si requieres que tu sitio web sea rastreado con un proxy configurado para una región o país específico.
Actualmente soportamos los siguientes proxies:
Rotativo: United States, Germany, France, United Kingdom, Czechia, Hungary
Estático:
United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Australia - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Tipo de rastreador
Elija con qué exhaustividad el rastreador renderiza cada página al sincronizar este sitio web.
Las páginas sincronizadas en blanco o truncadas suelen significar renderizado por JavaScript. Cambie a Full y vuelva a sincronizar.
Full es más pesado, por lo que es más probable que ponga una fuente grande en un programa reducido.
Puede cambiar esto en una fuente existente y volver a sincronizar para comparar.
Opción | Qué hace | Úselo cuando |
Rápido | Lee HTML sin ejecutar JavaScript. | El contenido está en el HTML inicial: la mayoría de los blogs, documentación, help centers. |
Auto (predeterminado) | Seleccionamos y cambiamos a Full si el sitio necesita JavaScript. | No está seguro. Adecuado para casi todos. |
Full | Carga cada página en un navegador y ejecuta JavaScript. Más lento. | El contenido solo aparece después de que se ejecutan los scripts, aplicaciones de una sola página y páginas con mucho JavaScript. |
Ignorar URLs canónicas
Cuando está activado, el scraper web ignora las etiquetas de enlace canónico (rel="canonical") y trata cada URL como una página distinta. Esta opción está desactivada por defecto.
Esto es útil cuando un sitio apunta muchas páginas a una URL canónica y como resultado se pierde contenido.
Excluir parámetros de consulta y respetar robots.txt
Hay dos interruptores más bajo Advanced settings. Ambos están desactivados por defecto.
Respect robots.txt: hace que el rastreador obedezca las reglas disallow en el robots.txt de su sitio. Enciéndalo para mantener la sincronización consistente con lo que permite que otros rastreadores alcancen. Si robots.txt desautoriza rutas que contienen contenido que desea en Fin, esto reducirá lo que se sincroniza.
Exclude query parameters: omite cualquier URL con una cadena de consulta (?). Enciéndalo cuando su sitio agregue parámetros de seguimiento, sesión o ordenación que produzcan muchas páginas casi duplicadas. Déjelo apagado si el contenido real vive detrás de una cadena de consulta, como /docs?page=intro — esas páginas también se omitirían.
Audiencias objetivo
El paso Target le permite establecer una audiencia predeterminada para todas las páginas sincronizadas y crear reglas basadas en URL para asignar audiencias específicas automáticamente según patrones de URL — sin etiquetado manual.
Primero decida si el contenido de esta fuente está habilitado para Fin AI Agent y/o Copilot.
Luego puede establecer una audiencia predeterminada de Fin para aplicar a todas las páginas sincronizadas desde esta fuente (si no se establece una predeterminada, el contenido por defecto es Everyone), o crear reglas para asignar audiencias específicas en función de patrones de URL.
Por ejemplo: Si la URL contiene /uk, asigne la audiencia UK. Las reglas se evalúan durante la sincronización, por lo que Fin y Copilot siempre sirven el contenido correcto a la audiencia adecuada.
Cada regla admite tres comparadores de URL:
Empieza con — coincide con URLs que comienzan con un prefijo dado.
Termina con — coincide con URLs que terminan con un sufijo dado.
Contiene — coincide con URLs que contienen una subcadena dada.
Nota:
Una vista previa en vivo muestra cuántas páginas coinciden con cada regla, ayudándole a validar las reglas antes de guardar. Esto requiere que haya un sitemap disponible para su origen de sincronización web. Sin un sitemap, las reglas aún se aplican pero no puede obtener una vista previa de las coincidencias.
Las reglas se nombran automáticamente al crearlas pero se pueden renombrar. Se aplica un máximo de 10 reglas por origen de sincronización web.
Las reglas de audiencia son solo aditivas: añaden audiencias al contenido pero nunca eliminan asignaciones existentes. Eliminar una regla no deshace las asignaciones de audiencia pasadas.
Revisar configuración de sincronización
Por último, revise su configuración de sincronización y haga clic en Sync website para comenzar a sincronizar el contenido de su sitio web con Intercom.
Administrar fuentes de sitios web
Una vez que la sincronización esté completa, recibirá una notificación por correo electrónico y el sitio web aparecerá como una fuente sincronizada en Train > Content en la sección "Content sources".
Si hace clic en una fuente de sitio web, puede obtener una vista previa y administrar las páginas individuales que se sincronizaron desde la URL pública.
Nota: Las fuentes de sitios web son de solo lectura y no se pueden editar dentro de su espacio de trabajo Fin; deben editarse en la fuente.
Configurar ajustes
Cuando vea una página del sitio web, encontrará un panel "Detalles" a la derecha que contiene:
Datos: Vea el tipo de contenido, idioma, fecha de creación y última actualización (cuando se sincronizó por última vez con la fuente).
Fin: Habilitar/deshabilitar para Fin Agent y Fin Copilot. Cuando está habilitado, el contenido está disponible para clientes y compañeros de equipo, respectivamente
Programación: Active o desactive el contenido para Fin y Copilot en fechas establecidas.
Audience: Asegúrate de que los clientes solo reciban respuestas y vean contenido de Fin Agent que sea relevante para ellos.
Link: La URL pública de esta fuente del sitio web.
Reports: Rastrea con qué frecuencia este contenido está involucrado y se utiliza para resolver conversaciones por Fin Agent.
Tag: Agrega una etiqueta para agrupar páginas web y mantener el contenido organizado.
Hazlo disponible para Fin o Copilot
Para poner una fuente de sitio web a disposición de Fin Agent o Fin Copilot, ve a Train > Content y haz clic en la fuente del sitio web en la sección "Content sources", luego abre la página web relevante que sincronizaste.
Desde el panel "Details" desplázate hasta “Fin” y activa el interruptor:
Fin Agent - Esta configuración hará que la página web esté disponible para que Fin AI la use al responder a los clientes (respetará cualquier audience rules).
Fin Copilot - Esta configuración hará que la página web esté disponible para que Fin Copilot la use al responder a compañeros de equipo.
Programar disponibilidad del sitio web
Puedes programar cuándo las páginas del sitio web sincronizadas se activan o desactivan para Fin y Copilot, en una fecha, hora y zona horaria futuras. Establece solo una fecha de inicio, o establece tanto una fecha de inicio como de fin para crear una ventana de disponibilidad limitada. La programación se aplica a páginas individuales o en bloque.
Programar una sola página
Abre la página. En el panel derecho Detalles, busca la sección Scheduling dentro del desplegable Fin.
Haz clic en Schedule availability.
En el modal: selecciona el producto de IA (Fin for Service o Fin Copilot), establece la disponibilidad (Enable o Disable) y elige una fecha, hora y zona horaria.
Opcionalmente activa Set end date para agregar una fecha y hora de finalización: la acción se revertirá automáticamente en ese punto.
Haz clic en Schedule para confirmar.
Programar páginas en bloque
Selecciona varias páginas de la lista de contenido.
Ve al desplegable More actions y selecciona Schedule availability.
El mismo modal de programación se aplica a todos los elementos seleccionados.
Cómo funciona la programación
Start date only: La acción de habilitar/deshabilitar se ejecuta en el momento programado y permanece en efecto hasta que la cambies manualmente.
Start + end date: El contenido se activa (o desactiva) en la hora de inicio y luego revierte automáticamente en la hora de finalización.
Manual changes don't cancel a pending schedule: Si cambias manualmente la disponibilidad después de establecer una programación, la transición programada aún se ejecutará en el momento previsto y anulará tu cambio manual.
One pending schedule per item per agent: Establecer una nueva programación reemplaza la anterior — no hay duplicados.
Deleted content: Si una página se elimina antes de que se ejecute su programación, la programación simplemente no se aplicará y no se mostrará ningún error.
Hazlo disponible para una audiencia específica
Puedes asignar audiencias al contenido sincronizado automáticamente usando reglas basadas en URL durante la creación de la sincronización web, o manualmente página por página. Primero, necesitarás crear y definir la audiencia que quieras orientar.
Luego ve a Train > Content y haz clic en la fuente del sitio web en la sección "Content sources", luego abre la página web relevante que sincronizaste.
Desde el panel "Details" desplázate hasta “Fin” y usa el desplegable de audiencia para seleccionar una de tus audiencias predefinidas.
Note:
La audiencia predeterminada para las URL públicas es “Everyone”.
Fin Agent también respetará cualquier audiencia que apliques a una URL pública y solo usará este artículo para responder preguntas de los clientes si coinciden con las reglas de audiencia.
Agregar o editar reglas de audiencia en sincronizaciones existentes
No necesitas recrear una sincronización para agregar orientación por audiencia. Ve a Train > Content, selecciona la fuente, haz clic en el desplegable de configuración en la esquina superior derecha y selecciona Open settings. Navega al paso Target para agregar o editar reglas basadas en URL.
Note: Cuando se agregan reglas de audiencia a una sincronización web existente, se aplican retroactivamente a todo el contenido ya ingerido desde esa fuente — no solo al contenido nuevo que se agregue.
Volver a sincronizar o eliminar un sitio web como fuente
Si deseas volver a sincronizar o eliminar una URL pública como fuente, ve a Train > Content, y haz clic en la fuente del sitio web en la sección "Content sources", luego abre el desplegable Settings en la esquina superior derecha.
Aquí, puedes seleccionar si deseas Re-sync o Remove this source.
Tip: Las actualizaciones realizadas en tu sitio fuente no aparecerán en Intercom inmediatamente. Las resincornizaciones del sitio web ocurren automáticamente cada semana, pero puedes activar una resincornización manual en cualquier momento para mostrar el contenido más reciente antes.
Ver historial de sincronización del sitio web
Puedes ver una lista de sincronizaciones de sitios web pasadas para ver cuándo se ejecutaron por última vez, qué páginas se encontraron y qué páginas fallaron. Ve a Train > Content, y haz clic en la fuente del sitio web en la sección "Content sources", luego selecciona View sync history.
Cada fila de la tabla representa una ejecución pasada o activa, y puedes filtrar las ejecuciones por status (started, success, failed).
Incluye la siguiente información:
Fecha de sincronización
Estado
Páginas sincronizadas
Páginas excluidas
Páginas fallidas
Duración
Sincronización iniciada por
Si una sincronización ha fallado, puede pasar el cursor sobre el estado para ver una explicación detallada del motivo.
Las sincronizaciones automáticas se pausan cuando Fin no está usando un sitio web
Una nueva fuente se sincroniza según el calendario durante sus primeros 90 días sin excepción. Después de eso, continúa sincronizándose automáticamente si se cumple cualquiera de las siguientes condiciones:
Se usó una página de ella en una respuesta de Fin en los últimos 90 días.
De lo contrario, las sincronizaciones programadas se pausan.
Cuando está en pausa: las páginas permanecen en su Knowledge Hub y siguen estando disponibles para Fin y Copilot (nada se elimina). Solo se detiene el re-raspado, por lo que las ediciones en su sitio web no se detectarán.
Para restaurarla: El botón Sync now actualiza el contenido una vez, pero no reinicia el calendario. La sincronización automática se reanuda por sí sola una vez que Fin vuelve a usar la fuente.
Los sitios web que son costosos de rastrear se sincronizan con menos frecuencia
Los sitios muy grandes y los que requieren renderizado completo de JavaScript cuestan mucho más de rastrear. Cuando una fuente resulta ser de alto consumo de recursos, la movemos de un calendario semanal a uno de cada 14 días.
Esto ocurre automáticamente, por fuente. Para mantener un sitio grande en un calendario más rápido, limite el rastreo usando exclusiones de URL, o agregue subpáginas específicas en lugar de todo un domain.
Solución de problemas de sincronización de sitios web
Problemas comunes
Al importar contenido de un sitio web para habilitar a Fin, debe introducir la URL pública. Esto buscará todas las páginas anidadas bajo esa URL y las sincronizará para que Fin AI Agent las use.
Si el importador no devolvió el número de páginas que esperaba, hay varias razones...
La URL proporcionada no es el top level domain
La sincronización del sitio web funciona yendo a la URL que usted proporciona y luego buscando todas las páginas anidadas bajo esa URL. Estas páginas deben tener el mismo patrón de URL que la URL que usted proporciona.
Por ejemplo, si el top level domain es https://myhelpcenter.com/home, entonces todas las páginas que desee importar deben incluir el prefijo /home en la URL, p. ej. https://myhelpcenter.com/home/article. Si no lo hacen, elimine el prefijo y use el tronco de URL más básico, p. ej. https://myhelpcenter.com, y vuelva a intentar la importación.
La URL es privada
Si el contenido que desea usar está detrás de un inicio de sesión, Fin no podrá acceder a él ni importarlo.
Límites de páginas
La sincronización de sitios web tiene dos límites:
Dominios: puede sincronizar hasta 100 diferentes top-level domains.
Páginas por fuente: Fin sincroniza un máximo de 4.000 páginas de cada fuente.
Una sincronización también puede fallar si una sola página contiene una cantidad muy grande de contenido. Se le notificará por correo electrónico cada vez que una sincronización falle.
Nota:
Si una fuente tiene más de 4.000 páginas, divídala en varias fuentes para que cada una se mantenga por debajo del límite:
Particione el sitio en secciones más pequeñas y agregue cada sección como su propia fuente.
Sincronice rutas de URL diferentes por separado, por ejemplo, una fuente por área de producto o categoría.
Esto mantiene cada fuente por debajo del límite de páginas y reduce el contenido procesado por sincronización.
Sitios web restringidos a IPs regionales específicas
La sincronización de sitios web de Fin (utilizada para añadir URLs públicas para Fin AI Agent y Copilot) no utiliza en este momento una cadena de agente de usuario dedicada y personalizada.
Si su sitio tiene protección estricta contra rastreo, puede usar un static proxy para permitir en la lista un conjunto fijo de direcciones IP y garantizar que su contenido se ingiera. Seleccione un static proxy en Advanced settings al crear o editar la sincronización de su sitio web.
Por dirección IP: Si su sitio requiere lista de permitidos, seleccione un static proxy en Advanced settings — esto le proporciona un conjunto fijo de IPs para añadir a su lista de permitidos.
Estas solicitudes se usan solo para la sincronización de sitios web. No afectan su tráfico de Messenger ni el seguimiento de usuarios finales.
Las páginas de sitios no ingleses o internacionales no se están sincronizando
Si su sitemap incluye URLs con caracteres no ASCII (como letras acentuadas o escrituras como chino o árabe) algunas de esas páginas pueden no sincronizarse como se espera. El descubrimiento de sitemaps ahora admite estas URLs, pero todavía pueden tener problemas en otras partes del proceso de sincronización. Intente volver a sincronizar manualmente para resolverlo. Si las páginas siguen faltando, contacte con support.
Errores de sincronización de sitios web
Cuando sincroniza contenido de sitios web, puede ver diferentes estados que indican lo que ocurrió durante el proceso. Para ver el estado de sincronización de su sitio web vaya a Train > Content y seleccione la fuente del sitio web, luego use el menú desplegable Status para filtrar por:
Sincronizando
En vivo
Fallido
Excluido
Esto es lo que significa cada uno y qué puede hacer a continuación:
Sincronizando
La sincronización de páginas aún está en curso. Una sincronización inicial puede tardar desde unos minutos hasta más de una hora según la cantidad de contenido que tenga.
En vivo
La página se sincronizó correctamente y se puede habilitar para Fin y Copilot.
Nota: Una sincronización exitosa no siempre significa que pudimos extraer todo el contenido de la página. Si desea confirmar la cobertura completa, recomendamos previsualizar Fin con las respuestas que espera que encuentre en esa página.
Excluido
Estas páginas no se sincronizan intencionalmente porque las excluiste en la Advanced sync settings. No se pueden reintentar ni incluir a menos que se especifique lo contrario.
Error
Estos errores significan que la sincronización no se completó y pueden requerir cambios de tu parte antes de reintentar:
1. Error desconocido
Mensaje: “No se pudo acceder a esta página. Puede estar lenta o bloqueada. Intenta sincronizar de nuevo o contacta al soporte si falla.”
Qué significa: Algo nos impidió acceder a la página, pero la causa no está clara.
2. Sesión bloqueada / Límite de velocidad
Mensaje: “El sitio web nos está impidiendo acceder a su contenido. Comprueba si está siendo bloqueado por una configuración anti-crawler o un firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta al soporte.”
Qué significa: Tu sitio está bloqueando o limitando activamente nuestro crawler.
3. Errores de red, tiempo de espera o similares
Mensaje: “No se pudo acceder a esta página. Puede tardar en cargar o estar bloqueada por configuraciones anti-crawler o un firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta al soporte."
Qué significa: La página no se cargó a tiempo o no se pudo alcanzar debido a problemas de red o bloqueo.
4. Duplicado
Mensaje: “Esta página tiene el mismo contenido que otra que ya está sincronizada. Solo se incluirá una versión.”
Qué significa: Detectamos contenido idéntico en otra parte, por lo que solo se conserva una copia.
5. Filtrado por palabras clave
Mensaje: “Las páginas con palabras clave como category, collection o tag en la URL se excluyen por defecto, ya que normalmente no contienen contenido único. Si esta página debe incluirse, contacta al soporte.”
Qué significa: Estas URL a menudo representan listas, no páginas de contenido independientes.
6. Código de estado 400
Mensaje: “No se puede encontrar el contenido de la página. Comprueba que la URL sea válida y que la página cargue sin problemas.”
Qué significa: La URL puede estar rota o devolver un error en tu sitio web.
7. URL bloqueada
Mensaje: “Este website domain está bloqueado para sincronizar. Si lo necesitas, contacta al soporte.”
Qué significa: El domain está intencionalmente excluido de la sincronización.
Puedes reintentar la sincronización de una página fallida pasando el cursor sobre la página, seleccionando el menú de tres puntos y luego Volver a sincronizar.






















