Si deseas entrenar a Fin con contenido del sitio web, puedes hacerlo sincronizando la URL pública de ese sitio.
Comenzar
Ve a Train > Content y luego selecciona Website sync debajo de la sección "Add content".
Ahora ingresa la URL pública de tu sitio web (top-level domain) y haz clic en Siguiente.
Esto obtendrá todas las páginas de la URL del sitio web que proporciones y leerá todas las páginas del sub domain.
Consejos:
Proporciona el enlace a la página principal de tu external help center para mejores resultados.
Usa top-level domains (por ejemplo, https://myhelpcenter.com en lugar de https://myhelpcenter.com/articles).
Revisar páginas para sincronizar
Una vez que ingreses tu URL, verificaremos que sea válida y accesible. Luego deberás revisar las páginas para sincronizar. Todas las subpáginas vinculadas en cada sección seleccionada se sincronizarán. Selecciona solo contenido relevante y actualizado.
Consejos:
Selecciona páginas y secciones que contengan contenido de soporte como artículos de ayuda, guías o FAQS.
Evita seleccionar páginas de marketing, listados de productos o páginas con diseños complejos.
Todas las subpáginas vinculadas dentro de las secciones seleccionadas se incluirán automáticamente.
Siempre puedes actualizar tu selección más adelante en la configuración avanzada.
Configuración avanzada [opcional]
Selecciona el menú desplegable de Configuración avanzada para configurar URLs adicionales, excluir URLs, selectores CSS para excluir y más.
URLs adicionales
Las estructuras de los sitios web pueden variar. Para asegurarte de sincronizar tu contenido más relevante, recomendamos agregar URLs adicionales para esas subpáginas específicas.
Por ejemplo, si ingresas https://myhelpcenter.com/help como la URL principal arriba, también podrías querer agregar la URL específica como https://myhelpcenter.com/help/index.html
URLs para excluir
Para excluir ciertas páginas de las que no quieres sincronizar contenido, puedes agregar una lista de patrones glob de URL.
¿Qué es un patrón glob de URL?
Un glob es una cadena de caracteres literales y/o comodines usada para coincidir con rutas de archivos o URLs. Globbing es el acto de localizar archivos en un sistema de archivos usando uno o más globs. Usar patrones glob de URL también ayuda a obtener un rango de URLs que son mayormente iguales, con solo una pequeña parte cambiando entre las solicitudes.
Por ejemplo, este patrón glob de URL https://{store,docs}.example.com/** permite que el rastreador acceda a todas las URLs que comienzan con https://store.example.com/ o https://docs.example.com/ y https://example.com/**/*\?*foo=*
Consejo: ¿No estás seguro si tu patrón glob coincidirá con las URLs que quieres excluir? Puedes usar DigitalOcean's Glob Tool para probar patrones contra URLs de ejemplo antes de aplicarlos. (Esta es una herramienta de terceros no mantenida por Intercom.)
Selectores CSS para excluir
Para excluir ciertos elementos de la página, puedes usar selectores CSS de esas secciones o elementos específicos que quieres excluir.
Esto es útil para omitir contenido irrelevante de la página. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll(). Por defecto, ya eliminamos elementos comunes de navegación, encabezados, pies de página, modales y scripts.
Nota: Las imágenes ahora se procesan por defecto al sincronizar sitios web. Para controlar cómo Fin usa imágenes y GIFs en las respuestas, consulta Using images and GIFs in Fin AI Agent replies.
Selector CSS clicable
Esto permite que los elementos DOM identificados por el selector CSS sean clicados durante el proceso de sincronización web.
Esto es útil para expandir secciones colapsadas, para capturar su contenido de texto. El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Ejemplos son "[aria-expanded=\"false\"]", #expand_section
También se pueden describir condiciones complejas con un selector CSS. En CSS, encadenar selectores sin espacios crea una condición tipo AND, por ejemplo .button.blue.small coincidirá solo con elementos que tengan las tres clases.
Usar coma (,) como separador funciona como OR, por ejemplo .button, .blue, h1 apunta a todos los elementos con clase button, o clase blue, o encabezados de primer nivel.
Esperar para cargar selector CSS
Para apuntar contenido que puede tardar en aparecer en la página, puedes agregar un selector CSS que hará que el scraper web espere antes de extraer contenido.
Esto es útil para páginas en las que el reconocimiento predeterminado de carga de contenido por red inactiva falla. Configurar esta opción desactiva completamente el comportamiento predeterminado, y la página se procesará solo si aparece el elemento especificado por este selector.
Nota: El valor debe ser un selector CSS válido aceptado por la función document.querySelectorAll().
Mapa del sitio XML
Habilita el Mapa del sitio XML para una sincronización web más robusta en sitios que soportan sitemap, permitiendo acceder a páginas que podrían no ser alcanzables desde las URLs iniciales.
Si esta opción está habilitada, el scraper web buscará Sitemaps en los dominios de la URL fuente proporcionada y encolará URLs coincidentes de manera similar a los enlaces encontrados en las páginas rastreadas. También puedes referenciar un archivo sitemap.xml directamente agregándolo como otra URL de inicio, por ejemplo https://www.example.com/sitemap.xml.
Región del proxy
Puedes seleccionar un proxy para que el rastreador lo use si necesitas que tu sitio web sea rastreado con un proxy configurado en una región o país específico.
Actualmente soportamos los siguientes proxies:
Rotativo: Estados Unidos, Alemania, Francia, Reino Unido, Chequia, Hungría
Estático:
Estados Unidos - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Australia - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Tipo de rastreador
Elige qué tan a fondo el rastreador renderiza cada página mientras sincroniza este sitio web.
Las páginas que se sincronizan vacías o truncadas suelen significar renderizado de JavaScript. Cambia a Full y vuelve a sincronizar.
Full es más pesado, por lo que es más probable que programe una fuente grande en un horario reducido.
Puedes cambiar esto en una fuente existente y volver a sincronizar para comparar.
Opción | Qué hace | Úsalo cuando |
Rápido | Lee HTML sin ejecutar JavaScript. | El contenido está en el HTML inicial — la mayoría de blogs, documentos, help centers. |
Auto (predeterminado) | Nosotros elegimos y cambiamos a Full si el sitio necesita JavaScript. | No estás seguro. Adecuado para casi todos. |
Full | Carga cada página en un navegador y ejecuta JavaScript. Más lento. | El contenido solo aparece después de que se ejecutan los scripts, aplicaciones de una sola página, páginas con mucho JavaScript. |
Ignorar URLs canónicas
Cuando está activado, el web scraper ignora las etiquetas de enlace canónico (rel="canonical") y trata cada URL como una página distinta. Esta opción está desactivada por defecto.
Esto es útil cuando un sitio apunta muchas páginas a una URL canónica y se pierde contenido como resultado.
Excluir parámetros de consulta y respetar robots.txt
Hay dos interruptores más bajo Configuración avanzada. Ambos están desactivados por defecto.
Respetar robots.txt: hace que el rastreador obedezca las reglas de disallow en el robots.txt de tu sitio. Actívalo para mantener la sincronización consistente con lo que permites que otros rastreadores alcancen. Si robots.txt prohíbe rutas que contienen contenido que quieres en Fin, esto reducirá lo que se sincroniza.
Excluir parámetros de consulta: omite cualquier URL con una cadena de consulta (?). Actívalo cuando tu sitio añade parámetros de seguimiento, sesión o clasificación que producen muchas páginas casi duplicadas. Déjalo desactivado si el contenido real está detrás de una cadena de consulta, como /docs?page=intro — esas páginas también se omitirían.
Audiencias objetivo
El paso Target te permite establecer una audiencia predeterminada para todas las páginas sincronizadas y crear reglas basadas en URL para asignar audiencias específicas automáticamente según patrones de URL — sin etiquetado manual.
Primero decide si el contenido de esta fuente está habilitado para Fin AI Agent y/o Copilot.
Luego puedes establecer una audiencia Fin predeterminada para aplicar a todas las páginas sincronizadas desde esta fuente (si no se establece un predeterminado, el contenido se asigna por defecto a Everyone), o crear reglas para asignar audiencias específicas según patrones de URL.
Por ejemplo: Si la URL contiene /uk, asigna la audiencia del Reino Unido. Las reglas se evalúan durante la sincronización, por lo que Fin y Copilot siempre sirven el contenido correcto a la audiencia correcta.
Cada regla soporta tres comparadores de URL:
Empieza con — coincide con URLs que comienzan con un prefijo dado.
Termina con — coincide con URLs que terminan con un sufijo dado.
Contiene — coincide con URLs que contienen una subcadena dada.
Nota:
Una vista previa en vivo muestra cuántas páginas coinciden con cada regla, ayudándote a validar las reglas antes de guardar. Esto requiere que haya un sitemap disponible para tu fuente de sincronización web. Sin un sitemap, las reglas aún se aplican pero no puedes previsualizar coincidencias.
Las reglas se nombran automáticamente al crearlas pero pueden ser renombradas. Se aplica un máximo de 10 reglas por fuente de sincronización web.
Las reglas de audiencia son solo aditivas: añaden audiencias al contenido pero nunca eliminan asignaciones existentes. Eliminar una regla no deshace sus asignaciones de audiencia pasadas.
Revisar configuración de sincronización
Finalmente, revisa tu configuración de sincronización y luego haz clic en Sync website para comenzar a sincronizar el contenido de tu sitio web con Intercom.
Gestionar fuentes de sitios web
Una vez que la sincronización esté completa, recibirás una notificación por correo electrónico y el sitio web aparecerá como una fuente sincronizada en Train > Content bajo la sección "Content sources".
Si entras en una fuente de sitio web, puedes previsualizar y gestionar las páginas individuales que se sincronizaron desde la URL pública.
Nota: Las fuentes de sitios web son de solo lectura y no pueden ser editadas dentro de tu espacio de trabajo Fin, deben ser editadas en la fuente.
Configurar ajustes
Cuando ves una página web, encontrarás un panel de "Detalles" a la derecha que contiene:
Datos: Ver el tipo de contenido, idioma, fecha de creación y última actualización (cuándo se sincronizó por última vez con la fuente).
Fin: Habilitar/deshabilitar para Fin Agent y Fin Copilot. Cuando está habilitado, el contenido se vuelve disponible para clientes y compañeros, respectivamente
Programación: Activa o desactiva contenido para Fin y Copilot en fechas establecidas.
Audiencia: Asegúrate de que los clientes solo reciban respuestas y vean contenido de Fin Agent que sea relevante para ellos.
Enlace: La URL pública de esta fuente del sitio web.
Informes: Rastrea con qué frecuencia este contenido está involucrado y se usa para resolver conversaciones por Fin Agent.
Etiqueta: Añade una etiqueta para agrupar páginas web y mantener el contenido organizado.
Hazlo disponible para Fin o Copilot
Para hacer que una fuente de sitio web esté disponible para Fin Agent o Fin Copilot, ve a Train > Content y haz clic en la fuente del sitio web bajo la sección "Content sources", luego abre la página web relevante que has sincronizado.
Desde el panel "Details" , desplázate hacia abajo hasta “Fin” y activa el interruptor:
Fin Agent - Esta configuración hará que la página web esté disponible para que Fin AI la use al responder a los clientes (respetará cualquier regla de audiencia).
Fin Copilot - Esta configuración hará que la página web esté disponible para que Fin Copilot la use al responder a los compañeros de equipo.
Programa la disponibilidad del sitio web
Puedes programar cuándo las páginas web sincronizadas se activan o desactivan para Fin y Copilot, en una fecha, hora y zona horaria futuras. Establece solo una fecha de inicio, o establece tanto una fecha de inicio como de fin para crear una ventana de disponibilidad limitada. La programación se aplica a páginas individuales o en bloque.
Programa una sola página
Abre la página. En el panel de Detalles a la derecha, encuentra la sección Scheduling dentro del desplegable Fin.
Haz clic en Schedule availability.
En el modal: selecciona el producto de IA (Fin para Service o Fin Copilot), establece la disponibilidad (Habilitar o Deshabilitar) y elige una fecha, hora y zona horaria.
Opcionalmente activa Set end date para añadir una fecha y hora de finalización — la acción se revertirá automáticamente en ese momento.
Haz clic en Schedule para confirmar.
Programa páginas en bloque
Selecciona varias páginas de la lista de contenido.
Ve al desplegable More actions y selecciona Schedule availability.
El mismo modal de programación se aplica a todos los elementos seleccionados.
Cómo funciona la programación
Sólo fecha de inicio: La acción de habilitar/deshabilitar se ejecuta en el momento programado y permanece en efecto hasta que la cambies manualmente.
Fecha de inicio + fin: El contenido se activa (o desactiva) a la hora de inicio, luego se revierte automáticamente a la hora de fin.
Los cambios manuales no cancelan una programación pendiente: Si cambias manualmente la disponibilidad después de establecer una programación, la transición programada se ejecutará en el momento previsto y anulará tu cambio manual.
Una programación pendiente por elemento y agente: Establecer una nueva programación reemplaza la anterior — no hay duplicados.
Contenido eliminado: Si una página se elimina antes de que se ejecute su programación, la programación simplemente no se aplicará y no se mostrará ningún error.
Hazlo disponible para una audiencia específica
Puedes asignar audiencias al contenido sincronizado automáticamente usando reglas basadas en URL durante la creación de la sincronización web, o manualmente por página. Primero, necesitarás crear y definir la audiencia que deseas dirigir.
Luego ve a Train > Content y haz clic en la fuente del sitio web bajo la sección "Content sources", luego abre la página web relevante que has sincronizado.
Desde el panel "Details" , desplázate hacia abajo hasta “Fin” y usa el desplegable de audiencia para seleccionar una de tus audiencias predefinidas.
Nota:
La audiencia predeterminada para URLs públicas es “Everyone”.
Fin Agent también respetará cualquier audiencia que apliques a una URL pública y solo usará este artículo para responder preguntas de clientes si coinciden con las reglas de audiencia.
Agregar o editar reglas de audiencia en sincronizaciones existentes
No necesitas recrear una sincronización para añadir segmentación de audiencia. Ve a Train > Content, selecciona la fuente, haz clic en el desplegable de configuración en la parte superior derecha y selecciona Abrir configuración. Navega al paso Target para añadir o editar reglas basadas en URL.
Nota: Cuando se añaden reglas de audiencia a una sincronización web existente, se aplican retroactivamente a todo el contenido ya ingerido de esa fuente — no solo al contenido nuevo en adelante.
Volver a sincronizar o eliminar un sitio web como fuente
Si deseas volver a sincronizar o eliminar una URL pública como fuente, ve a Train > Content, y haz clic en la fuente del sitio web bajo la sección "Content sources", luego abre el desplegable Settings en la parte superior derecha.
Aquí, puedes seleccionar si Volver a sincronizar o Eliminar esta fuente.
Consejo: Las actualizaciones realizadas en tu sitio web fuente no aparecerán inmediatamente en Intercom. Las re-sincronizaciones del sitio web ocurren automáticamente cada semana, pero puedes activar una re-sincronización manual en cualquier momento para mostrar el contenido más reciente antes.
Ver historial de sincronización del sitio web
Puedes ver una lista de sincronizaciones pasadas para ver cuándo se ejecutaron por última vez, qué páginas se encontraron y cualquier página fallida. Ve a Train > Content, y haz clic en la fuente del sitio web bajo la sección "Content sources", luego selecciona Ver historial de sincronización.
Cada fila en la tabla representa una ejecución pasada o activa, y puedes filtrar las ejecuciones por estado (iniciada, exitosa, fallida).
Incluye la siguiente información:
Fecha de sincronización
Estado
Páginas sincronizadas
Páginas excluidas
Páginas fallidas
Duración
Sincronización iniciada por
Si una sincronización ha fallado, puedes pasar el cursor sobre el estado para ver una explicación detallada del motivo.
Las sincronizaciones automáticas se pausan cuando Fin no está usando un sitio web
Una nueva fuente se sincroniza según el horario durante sus primeros 90 días sin excepción. Después de eso, sigue sincronizándose automáticamente si se cumple alguna de estas condiciones:
Se usó una página de ella en una respuesta de Fin en los últimos 90 días.
De lo contrario, las sincronizaciones programadas se pausan.
Cuando está en pausa: las páginas permanecen en tu Knowledge Hub y siguen disponibles para Fin y Copilot (nada se elimina). Solo se detiene el re-crawl, por lo que las ediciones en tu sitio no se detectarán.
Para restaurarlo: El botón Sync now actualiza el contenido una vez pero no reinicia el horario. La sincronización automática se reanuda sola cuando Fin vuelve a usar la fuente.
Los sitios web que son pesados de rastrear se sincronizan con menos frecuencia
Los sitios muy grandes y los que necesitan renderizado completo de JavaScript cuestan mucho más rastrear. Cuando una fuente resulta ser pesada en recursos, la movemos de un horario semanal a uno de cada 14 días.
Esto ocurre automáticamente, por fuente. Para mantener un sitio grande en un horario más rápido, reduce el rastreo usando exclusiones de URL o añade subpáginas específicas en lugar de un dominio completo.
Solución de problemas de sincronización de sitios web
Problemas comunes
Al importar contenido web para habilitar Fin, debes ingresar la URL pública. Esto buscará todas las páginas anidadas bajo esa URL y las sincronizará para que Fin AI Agent las use.
Si el importador no devolvió el número de páginas que esperabas, hay varias razones...
La URL proporcionada no es el dominio de nivel superior
La sincronización del sitio web funciona yendo a la URL que proporcionas y luego buscando todas las páginas anidadas bajo esa URL. Estas páginas deben tener el mismo patrón de URL que la URL que proporcionas.
Por ejemplo, si el dominio de nivel superior es https://myhelpcenter.com/home, entonces todas las páginas que quieras importar deben incluir el prefijo /home en la URL, por ejemplo https://myhelpcenter.com/home/article. Si no lo hacen, elimina el prefijo y usa el tallo de URL más básico, por ejemplo https://myhelpcenter.com, luego intenta importar de nuevo.
La URL es privada
Si el contenido que quieres usar está detrás de un inicio de sesión, Fin no podrá acceder ni importarlo.
Límites de páginas
La sincronización del sitio web tiene dos límites:
Domains: puedes sincronizar hasta 100 dominios de nivel superior diferentes.
Páginas por fuente: Fin sincroniza un máximo de 4,000 páginas de cada fuente.
Una sincronización también puede fallar si una sola página contiene una cantidad muy grande de contenido. Se te notificará por correo electrónico cada vez que una sincronización falle.
Nota:
Si una fuente tiene más de 4,000 páginas, divídela en varias fuentes para que cada una se mantenga bajo el límite:
Divide el sitio en secciones más pequeñas y añade cada sección como su propia fuente.
Sincroniza diferentes rutas URL por separado, por ejemplo, una fuente por área de producto o categoría.
Esto mantiene cada fuente bajo el límite de páginas y reduce el contenido procesado por sincronización.
Sitios web restringidos a IP regionales específicas
La sincronización de sitios web de Fin (usada para añadir URLs públicas para Fin AI Agent y Copilot) no usa una cadena de agente de usuario dedicada y personalizada en este momento.
Si tu sitio tiene protección estricta contra rastreo, puedes usar un proxy estático para permitir una lista fija de direcciones IP y asegurar que tu contenido sea ingerido. Selecciona un proxy estático en Advanced settings al crear o editar tu sincronización de sitio web.
Por dirección IP: Si tu sitio requiere lista blanca, selecciona un proxy estático en Advanced settings — esto te da un conjunto fijo de IPs para añadir a tu lista blanca.
Estas solicitudes se usan solo para la sincronización del sitio web. No afectan el tráfico de Messenger ni el seguimiento de usuarios finales.
Las páginas de sitios no ingleses o internacionales no se sincronizan
Si tu sitemap incluye URLs con caracteres no ASCII (como letras acentuadas o escrituras como chino o árabe), algunas de esas páginas pueden no sincronizarse como se espera. El descubrimiento de sitemap ahora soporta estas URLs, pero aún pueden tener problemas en otras partes del proceso de sincronización. Intenta sincronizar manualmente para resolverlo. Si las páginas siguen faltando, contacta con soporte.
Errores de sincronización de sitios web
Cuando sincronizas contenido web, puedes ver diferentes estados que indican qué ocurrió durante el proceso. Para ver el estado de sincronización de tu sitio web, ve a Train > Content y selecciona la fuente del sitio web, luego usa el menú desplegable Status para filtrar por:
Sincronizando
En vivo
Fallido
Excluido
Esto es lo que significa cada uno y qué puedes hacer a continuación:
Sincronizando
La sincronización de páginas aún está en progreso. Una sincronización inicial puede tardar desde unos minutos hasta más de una hora, según la cantidad de contenido que tengas.
En vivo
La página se sincronizó correctamente y puede estar habilitada para Fin y Copilot.
Nota: Una sincronización exitosa no siempre significa que pudimos extraer todo el contenido de la página. Si quieres confirmar la cobertura completa, recomendamos previsualizar Fin con las respuestas que esperas encontrar en esa página.
Excluido
Estas páginas no se sincronizan intencionalmente porque las excluiste en la Configuración avanzada de sincronización. No se pueden reintentar ni incluir a menos que se especifique lo contrario.
Fallido
Estos errores significan que la sincronización no se completó y pueden requerir cambios de tu parte antes de reintentar:
1. Error desconocido
Mensaje: “No se pudo acceder a esta página. Puede estar lenta o bloqueada. Intenta sincronizar de nuevo o contacta al help center si falla.”
Qué significa: Algo nos impidió acceder a la página, pero la causa no está clara.
2. Sesión bloqueada / Límite de tasa
Mensaje: “El sitio web nos está impidiendo acceder a su contenido. Verifica si está bloqueado por una configuración anti-crawler o firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta al help center.”
Qué significa: Tu sitio está bloqueando o limitando activamente nuestro crawler.
3. Errores de red, tiempo de espera o similares
Mensaje: “No se pudo acceder a esta página. Puede estar lenta para cargar o bloqueada por configuraciones anti-crawler o firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta al help center.”
Qué significa: La página no cargó a tiempo o no se pudo alcanzar debido a problemas de red o bloqueo.
Qué hacer: Un error de "Tiempo de espera de navegación" suele ser causado por protección contra bots o software de seguridad en tu sitio que bloquea el crawler de Intercom. Para resolverlo, pon en la lista blanca las direcciones IP proxy estáticas listadas en la sección de Configuración avanzada arriba, luego selecciona la región proxy correspondiente en Configuración avanzada al crear o editar la sincronización de tu sitio web, y vuelve a intentar la sincronización.
4. Duplicado
Mensaje: “Esta página tiene el mismo contenido que otra que ya está sincronizada. Solo se incluirá una versión.”
Qué significa: Detectamos contenido idéntico en otro lugar, por lo que solo se mantiene una copia.
5. Filtrado por palabra clave
Mensaje: “Las páginas con palabras clave como category, collection o tag en la URL se excluyen por defecto, ya que usualmente no contienen contenido único. Si esta página debe incluirse, contacta al help center.”
Qué significa: Estas URLs suelen representar listas, no páginas de contenido independientes.
6. Código de estado 400
Mensaje: “No se puede encontrar el contenido de la página. Verifica que la URL sea válida y que la página cargue sin problemas.”
Qué significa: La URL puede estar rota o devolver un error en tu sitio web.
7. URL bloqueada
Mensaje: “Este domain está bloqueado para sincronización. Si lo necesitas, contacta al help center.”
Qué significa: El domain está excluido intencionalmente de la sincronización.
Puedes reintentar la sincronización de una página fallida pasando el cursor sobre la página, seleccionando el menú de tres puntos y luego seleccionando Resync.






















