Ir al contenido principal

Sincronizar y gestionar sitios web

Cómo entrenar a Fin con URLs públicas de tu sitio web.

Si deseas entrenar a Fin con el contenido de un sitio web, puedes hacerlo sincronizando la URL pública de ese sitio.


Comenzar

Ve a Train > Content y luego selecciona Website sync debajo de la sección "Add content".

Ahora introduce la URL pública de tu sitio web (top-level domain) y haz clic en Siguiente.

Esto obtendrá todas las páginas de la URL del sitio web que proporciones y leerá todas las páginas del sub domain.

Consejos:

Revisar páginas para sincronizar

Una vez que ingreses tu URL, comprobaremos que sea válida y accesible. Luego deberás revisar las páginas para sincronizar. Todas las subpáginas enlazadas en cada sección seleccionada se sincronizarán. Selecciona solo contenido relevante y actualizado.

Consejos:

  • Selecciona páginas y secciones que contengan contenido de soporte como artículos de ayuda, guías o FAQS.

  • Evita seleccionar páginas de marketing, listas de productos o páginas con diseños complejos.

  • Todas las subpáginas vinculadas dentro de las secciones seleccionadas se incluirán automáticamente.

  • Siempre puedes actualizar tu selección más adelante en la configuración avanzada.

Configuración avanzada [optional]

Selecciona el desplegable Advanced settings para configurar URLs adicionales, excluir URLs, selectores CSS a excluir y más.

URLs adicionales

Las estructuras de los sitios web pueden variar. Para asegurarte de que sincronizamos tu contenido más relevante, te recomendamos que agregues URLs adicionales para esas subpáginas específicas.

Por ejemplo, si ingresas https://myhelpcenter.com/help como URL principal arriba, también puede que quieras añadir la URL específica como https://myhelpcenter.com/help/index.html

URLs para excluir

Para excluir ciertas páginas de las que no deseas sincronizar contenido, puedes añadir una lista de globs de URL.

¿Qué es un glob de URL?

Un glob es una cadena de caracteres literales y/o comodines usada para coincidir rutas de archivos o URLs. Globbing es el acto de localizar archivos en un sistema de archivos usando uno o más globs. Usar globs de URL también ayuda a obtener un rango de URLs que son mayormente iguales, con solo una pequeña porción que cambia entre las solicitudes.

Por ejemplo, este glob de URL https://{store,docs}.example.com/** permite al rastreador acceder a todas las URLs que comienzan con https://store.example.com/ o https://docs.example.com/ y https://example.com/**/*\?*foo=*

Consejo: ¿No estás seguro si tu patrón glob coincidirá con las URLs que quieres excluir? Puedes usar DigitalOcean's Glob Tool para probar patrones contra URLs de ejemplo antes de aplicarlos. (Esta es una herramienta de terceros no mantenida por Intercom.)

Selectores CSS para excluir

Para excluir ciertos elementos de la página, puedes usar selectores CSS de esas secciones o elementos específicos que quieres excluir.

Esto es útil para omitir contenido irrelevante de la página. El valor debe ser un selector CSS válido tal como lo acepta la función document.querySelectorAll(). Por defecto, ya eliminamos elementos comunes de navegación, encabezados, pies de página, modales, scripts e imágenes en línea.

Selector CSS clicable

Esto permite que los elementos DOM identificados por el selector CSS sean clicados durante el proceso de sincronización web.

Esto es útil para expandir secciones colapsadas, para capturar su contenido de texto. El valor debe ser un selector CSS válido tal como lo acepta la función document.querySelectorAll().

Los ejemplos son "[aria-expanded=\"false\"]", #expand_section

También se pueden describir condiciones complejas con un selector CSS. En CSS, encadenar selectores sin espacios crea una condición tipo AND, por ejemplo .button.blue.small coincidirá solo con elementos que tengan las tres clases.

Usar la coma (,) como separador funciona como OR, por ejemplo .button, .blue, h1 apunta a todos los elementos con la clase button, o la clase blue, o encabezados de primer nivel.

Esperar para cargar el selector CSS

Para dirigirte a contenido que pueda tardar en aparecer en la página, puedes añadir un selector CSS que hará que el scraper web espere antes de extraer el contenido.

Esto es útil para páginas en las que el reconocimiento predeterminado de carga de contenido por inactividad de la red falla. Configurar esta opción desactiva completamente el comportamiento predeterminado, y la página se procesará solo si aparece el elemento especificado por este selector.

Nota: El valor debe ser un selector CSS válido tal como lo acepta la función document.querySelectorAll().

Mapa del sitio XML

Activa el Mapa del sitio XML para una sincronización web más robusta en sitios con soporte de sitemaps, permitiendo el acceso a páginas que podrían no ser alcanzables desde las URLs iniciales.

Si esta opción está activada, el scraper web buscará Sitemaps en los dominios de la URL de origen proporcionada y encolará URLs coincidentes de forma similar a los enlaces encontrados en las páginas rastreadas. También puedes referenciar un archivo sitemap.xml directamente añadiéndolo como otra Start URL p. ej. https://www.example.com/sitemap.xml.

Región del proxy

Puedes seleccionar un proxy para que el rastreador lo use si requieres que tu sitio web sea rastreado con un proxy configurado en una región o país específico.

Actualmente admitimos los siguientes proxies:

  • Rotating: United States, Germany, France, United Kingdom, Czechia, Hungary

  • Estático:

    • United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • Australia - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

Tipo de rastreador

Elige qué tan a fondo el rastreador renderiza cada página mientras sincroniza este sitio web.

  • Las páginas que se sincronizan vacías o truncadas suelen deberse al renderizado de JavaScript. Cambia a Full y vuelve a sincronizar.

  • Full consume más recursos, por lo que es más probable que ponga una fuente grande en un horario reducido.

  • Puedes cambiar esto en una fuente existente y volver a sincronizar para comparar.

Opción

Qué hace

Úsalo cuando

Rápido

Lee HTML sin ejecutar JavaScript.

El contenido está en el HTML inicial — la mayoría de blogs, docs, help centers.

Auto (predeterminado)

Seleccionamos y cambiamos a Full si el sitio necesita JavaScript.

No estás seguro. Adecuado para casi todos.

Full

Carga cada página en un navegador y ejecuta JavaScript. Más lento.

El contenido solo aparece después de que se ejecutan los scripts; aplicaciones de una sola página y páginas con mucho JavaScript.

Ignorar URLs canónicas

Cuando está habilitado, el rastreador web ignora las etiquetas de enlace canonical (rel="canonical") y trata cada URL como una página distinta. Esta opción está desactivada por defecto.

Esto es útil cuando un sitio apunta muchas páginas a una URL canónica y se pierde contenido como resultado.

Excluir parámetros de consulta y respetar robots.txt

Hay dos palancas más en Advanced settings. Ambas están desactivadas por defecto.

Respect robots.txt: hace que el rastreador obedezca las reglas disallow en el robots.txt de tu sitio. Actívalo para que la sincronización sea coherente con lo que permites que otros rastreadores alcancen. Si robots.txt prohíbe rutas que contienen contenido que quieres en Fin, esto reducirá lo que se sincroniza.

Exclude query parameters: omite cualquier URL con una cadena de consulta (?). Actívalo cuando tu sitio añada parámetros de seguimiento, sesión o ordenación que produzcan muchas páginas casi duplicadas. Déjalo desactivado si el contenido real vive detrás de una cadena de consulta, como /docs?page=intro —esas páginas también se omitirían.

Audiencias objetivo

El paso Target te permite establecer una audiencia predeterminada para todas las páginas sincronizadas y crear reglas basadas en URL para asignar audiencias específicas automáticamente según patrones de URL — sin etiquetado manual.

Primero decide si el contenido de esta fuente está habilitado para Fin AI Agent y/o Copilot.

Luego puedes configurar una audiencia predeterminada de Fin para aplicar a todas las páginas sincronizadas desde esta fuente (si no se establece una predeterminada, el contenido por defecto será Everyone), o crear reglas para asignar audiencias específicas según patrones de URL.

Por ejemplo: Si la URL contiene /uk, asigna la audiencia UK. Las reglas se evalúan durante la sincronización, por lo que Fin y Copilot siempre sirven el contenido correcto a la audiencia adecuada.

Cada regla admite tres comparadores de URL:

  • Empieza con — coincide con URLs que comienzan con un prefijo dado.

  • Termina con — coincide con URLs que terminan con un sufijo dado.

  • Contiene — coincide con URLs que contienen una subcadena dada.

Nota:

  • Una vista previa en vivo muestra cuántas páginas coinciden con cada regla, ayudándote a validar las reglas antes de guardar. Esto requiere que haya un sitemap disponible para tu origen de sincronización web. Sin un sitemap, las reglas siguen aplicándose pero no puedes previsualizar coincidencias.

  • Las reglas reciben un nombre automáticamente al crearse pero se pueden renombrar. Se aplica un máximo de 10 reglas por origen de sincronización web.

  • Las reglas de audiencia solo se añaden: agregan audiencias al contenido pero nunca eliminan asignaciones existentes. Eliminar una regla no deshace sus asignaciones de audiencia pasadas.

Revisar configuración de sincronización

Por último, revisa la configuración de sincronización y haz clic en Sync website para empezar a sincronizar el contenido de tu sitio web con Intercom.


Administrar fuentes del sitio web

Una vez que la sincronización se complete, recibirás una notificación por correo electrónico y el sitio web aparecerá como una fuente sincronizada en Train > Content en la sección "Content sources".

Si haces clic en una fuente del sitio web, puedes previsualizar y administrar las páginas individuales que se sincronizaron desde la URL pública.

Nota: Las fuentes del sitio web son de solo lectura y no se pueden editar dentro de tu espacio de trabajo Fin; deben editarse en la fuente.

Configurar ajustes

Cuando ves una página del sitio web, encontrarás un panel "Detalles" a la derecha que contiene:

  • Datos: Ver el tipo de contenido, idioma, fecha de creación y última actualización (cuando se sincronizó por última vez con la fuente).

  • Fin: Habilitar/deshabilitar para Fin Agent y Fin Copilot. Cuando está habilitado, el contenido se vuelve accesible para clientes y compañeros, respectivamente

    • Programación: Activa o desactiva el contenido para Fin y Copilot en fechas establecidas.

    • Audience: Asegúrate de que los clientes solo reciban respuestas y vean contenido de Fin Agent que sea relevante para ellos.

  • Link: La URL pública de esta fuente del sitio web.

  • Reports: Registra con qué frecuencia este contenido participa y se usa para resolver conversaciones por Fin Agent.

  • Tag: Añade una etiqueta para agrupar páginas web y mantener el contenido organizado.

Hazlo disponible para Fin o Copilot

Para que una fuente del sitio web esté disponible para Fin Agent o Fin Copilot, ve a Train > Content y haz clic en la fuente del sitio web en la sección "Content sources", luego abre la página web relevante que hayas sincronizado.

Desde el panel "Details" desplázate hasta “Fin” y activa el interruptor:

  • Fin Agent - Esta configuración hará que la página web esté disponible para que Fin AI la use al responder a los clientes (respetará cualquier audience rules).

  • Fin Copilot - Esta configuración hará que la página web esté disponible para que Fin Copilot la use al responder a los compañeros de equipo.

Programar disponibilidad del sitio web

Puedes programar cuándo las páginas del sitio web sincronizadas se activan o desactivan para Fin y Copilot, en una fecha, hora y zona horaria futuras. Establece solo una fecha de inicio, o establece tanto una fecha de inicio como de finalización para crear una ventana de disponibilidad limitada. La programación se aplica a páginas individuales o en lote.

Programar una sola página

  1. Abre la página. En el panel derecho Details, encuentra la sección Scheduling dentro del desplegable Fin.

  2. Haz clic en Schedule availability.

  3. En el modal: selecciona el producto de IA (Fin for Service o Fin Copilot), establece la disponibilidad (Enable o Disable) y elige una fecha, hora y zona horaria.

  4. Opcionalmente activa Set end date para añadir una fecha y hora de finalización: la acción se revertirá automáticamente en ese momento.

  5. Haz clic en Schedule para confirmar.

Programar páginas en bloque

  1. Selecciona varias páginas de la lista de contenido.

  2. Ve al desplegable More actions y selecciona Schedule availability.

  3. El mismo modal de programación se aplica a todos los elementos seleccionados.

Cómo funciona la programación

  • Start date only: La acción de activar/desactivar se ejecuta en el momento programado y permanece en efecto hasta que la cambies manualmente.

  • Start + end date: El contenido se activa (o desactiva) en la hora de inicio, y luego vuelve automáticamente en la hora de finalización.

  • Manual changes don't cancel a pending schedule: Si activas o desactivas manualmente la disponibilidad después de establecer una programación, la transición programada aún se ejecutará en el momento previsto y anulará tu cambio manual.

  • One pending schedule per item per agent: Establecer una nueva programación reemplaza la anterior — no hay duplicados.

  • Deleted content: Si una página se elimina antes de que se ejecute su programación, la programación simplemente no se aplicará y no se mostrará ningún error.

Hazlo disponible para una audiencia específica

Puedes asignar audiencias al contenido sincronizado automáticamente usando reglas basadas en URL durante la creación de la sincronización web, o manualmente por página. Primero, deberás crear y definir la audiencia que quieras orientar.

Luego ve a Train > Content y haz clic en la fuente del sitio web en la sección "Content sources", luego abre la página web relevante que hayas sincronizado.

Desde el panel "Details" desplázate hasta “Fin” y usa el desplegable de audiencia para seleccionar una de tus audiencias predefinidas.

Note:

  • La audiencia predeterminada para las URL públicas es “Everyone”.

  • Fin Agent también respetará cualquier audiencia que apliques a una URL pública y solo usará este artículo para responder preguntas de los clientes si coinciden con las reglas de audiencia.

Agregar o editar reglas de audiencia en sincronizaciones existentes

No necesitas volver a crear una sincronización para añadir el direccionamiento de audiencia. Ve a Train > Content, selecciona la fuente, haz clic en el desplegable de configuración en la esquina superior derecha y selecciona Open settings. Navega al paso Target para agregar o editar reglas basadas en URL.

Note: Cuando se añaden reglas de audiencia a una sincronización web existente, se aplican retroactivamente a todo el contenido ya ingerido de esa fuente — no solo al contenido nuevo en adelante.

Volver a sincronizar o eliminar un sitio web como fuente

Si deseas volver a sincronizar o eliminar una URL pública como fuente, ve a Train > Content, y haz clic en la fuente del sitio web en la sección "Content sources", luego abre el desplegable Settings en la esquina superior derecha.

Aquí, puedes seleccionar si Re-sync o Remove this source.

Tip: Las actualizaciones realizadas en tu sitio web de origen no aparecerán en Intercom de inmediato. Las re-sincronizaciones del sitio web se realizan automáticamente cada semana, pero puedes activar una re-sincronización manual en cualquier momento para mostrar el contenido más reciente antes.

Ver historial de sincronización del sitio web

Puedes ver una lista de sincronizaciones pasadas para ver cuándo se ejecutaron por última vez, qué páginas se encontraron y cualquier página que falló. Ve a Train > Content, y haz clic en la fuente del sitio web en la sección "Content sources", luego selecciona View sync history.


Cada fila de la tabla representa una ejecución pasada o activa, y puedes filtrar las ejecuciones por status (started, success, failed).

Incluye la siguiente información:

  • Fecha de sincronización

  • Estado

  • Páginas sincronizadas

  • Páginas excluidas

  • Páginas fallidas

  • Duración

  • Sincronización iniciada por

Si una sincronización ha fallado, puede colocar el cursor sobre el estado para ver una explicación detallada del motivo.

Las sincronizaciones automáticas se pausan cuando Fin no está usando un sitio web

Una nueva fuente se sincroniza según el calendario durante sus primeros 90 días sin excepción. Después de eso, sigue sincronizándose automáticamente si se cumple alguna de estas condiciones:

  • Se usó una página de ella en una respuesta de Fin en los últimos 90 días.

De lo contrario, las sincronizaciones programadas se pausan.

Cuando está en pausa: las páginas permanecen en tu Knowledge Hub y siguen disponibles para Fin y Copilot (nada se elimina). Solo se detiene el re-rastreo, por lo que las ediciones en tu sitio no se detectarán.

Para restaurarlo: El botón Sync now actualiza el contenido una vez pero no reinicia el calendario. La sincronización automática se reanuda por sí sola una vez que Fin vuelve a usar la fuente.

Los sitios web que requieren mucho rastreo se sincronizan con menos frecuencia

Los sitios muy grandes y los que necesitan renderizado completo de JavaScript cuestan mucho más rastrear. Cuando una fuente resulta ser de alto consumo de recursos, la movemos de un calendario semanal a uno de cada 14 días.

Esto ocurre automáticamente, por fuente. Para mantener un sitio grande en un calendario más rápido, reduzca el rastreo usando exclusiones de URL, o agregue subpáginas específicas en lugar de todo un domain.


Solución de problemas de sincronización del sitio web

Problemas comunes

Al importar contenido del sitio web para habilitar Fin, debes ingresar la URL pública. Esto buscará todas las páginas anidadas bajo esa URL y las sincronizará para que Fin AI Agent las use.

Si el importador no devolvió el número de páginas que esperabas, hay varias razones...

La URL proporcionada no es el dominio de nivel superior

La sincronización del sitio web funciona yendo a la URL que proporcionas y luego buscando todas las páginas anidadas bajo esa URL. Estas páginas deben tener el mismo patrón de URL que la URL que proporcionaste.

Por ejemplo, si el dominio de nivel superior es https://myhelpcenter.com/home, entonces todas las páginas que quieras importar deben incluir el prefijo /home en la URL, p. ej. https://myhelpcenter.com/home/article. Si no lo hacen, elimina el prefijo y usa el tallo de URL más básico, p. ej. https://myhelpcenter.com, y vuelve a intentar la importación.

La URL es privada

Si el contenido que quieres usar está detrás de un inicio de sesión, Fin no podrá acceder ni importarlo.

Límites de páginas

La sincronización del sitio web tiene dos límites:

  • Domains: puedes sincronizar hasta 100 diferentes dominios de nivel superior.

  • Pages per source: Fin sincroniza un máximo de 4.000 páginas desde cada source.

Una sincronización también puede fallar si una sola página contiene una cantidad muy grande de contenido. Se te notificará por correo electrónico cada vez que una sincronización falle.

Nota:

  • Si una fuente tiene más de 4.000 páginas, divídela en varias fuentes para que cada una permanezca por debajo del límite:

    • Particiona el sitio en secciones más pequeñas y añade cada sección como su propia source.

    • Sincroniza diferentes rutas de URL por separado, por ejemplo, una source por área de producto o categoría.

  • Esto mantiene cada source por debajo del límite de páginas y reduce el contenido procesado por sincronización.

Sitios web restringidos a IPs regionales específicas

La sincronización del sitio web de Fin (usada para añadir URLs públicas para Fin AI Agent y Copilot) no usa en este momento una cadena de agente de usuario dedicada y personalizada.

Si tu sitio tiene protección estricta contra rastreo, puedes usar un proxy estático para permitir en la lista un conjunto fijo de direcciones IP y asegurarte de que tu contenido se ingiera. Selecciona un proxy estático en Advanced settings al crear o editar tu sincronización del sitio web.

  • Por dirección IP: Si tu sitio requiere permitir en la lista, selecciona un proxy estático en Advanced settings: esto te da un conjunto fijo de IPs para añadir a tu lista de permitidos.

  • Estas solicitudes se usan solo para la sincronización del sitio web. No afectan tu tráfico de Messenger ni el seguimiento de usuarios finales.

Las páginas de sitios no ingleses o internacionales no se están sincronizando

Si tu sitemap incluye URLs con caracteres no ASCII (como letras acentuadas, o escrituras como chino o árabe) algunas de esas páginas pueden no sincronizarse como se espera. El descubrimiento de sitemap ahora admite estas URLs, pero aún pueden tener problemas en otras partes del proceso de sincronización. Intenta volver a sincronizar manualmente para resolverlo. Si las páginas aún faltan, contacta con support.

Errores de sincronización del sitio web

Cuando sincronizas contenido de sitios web, puedes ver diferentes estados que indican lo que ocurrió durante el proceso. Para ver el estado de sincronización del sitio web ve a Train > Content y selecciona la fuente del sitio web, luego usa el menú desplegable Status para filtrar por:

  • Sincronizando

  • En vivo

  • Falló

  • Excluido

Esto es lo que significa cada uno y qué puedes hacer a continuación:

Sincronizando

La sincronización de páginas aún está en curso. Una sincronización inicial puede tardar desde unos minutos hasta más de una hora según la cantidad de contenido que tengas.

En vivo

La página se sincronizó correctamente y puede habilitarse para Fin y Copilot.

Nota: Una sincronización exitosa no siempre significa que pudimos extraer todo el contenido de la página. Si quieres confirmar la cobertura completa, recomendamos previsualizar Fin con las respuestas que esperas que encuentre en esa página.

Excluido

Estas páginas no se sincronizan intencionadamente porque las excluiste en los Advanced sync settings. No se pueden reintentar ni incluir salvo que se indique lo contrario.

Error

Estos errores significan que la sincronización no se completó y puede requerir cambios de tu parte antes de volver a intentarlo:

1. Error desconocido

  • Mensaje: “No se pudo acceder a esta página. Puede estar lenta o bloqueada. Intenta sincronizar de nuevo o contacta con soporte si falla.”

  • Qué significa: Algo nos impidió acceder a la página, pero la causa no está clara.

2. Sesión bloqueada / Límite de solicitudes

  • Mensaje: “El sitio web nos impide acceder a su contenido. Comprueba si está siendo bloqueado por una configuración anti-crawler o un firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta con soporte.”

  • Qué significa: Tu sitio está bloqueando o limitando activamente nuestro crawler.

3. Errores de red, tiempo de espera u otros similares

  • Mensaje: “No se pudo acceder a esta página. Puede tardar en cargarse o estar bloqueada por configuraciones anti-crawler o un firewall. Revisa la configuración de tu sitio e intenta sincronizar de nuevo. Si el problema persiste, contacta con soporte."

  • Qué significa: La página no se cargó a tiempo o no pudo alcanzarse debido a problemas de red o bloqueo.

    Qué hacer: Un error de "Navigation timeout" suele ser causado por protección contra bots o software de seguridad en tu sitio que bloquea el crawler de Intercom. Para resolverlo, pon en la lista blanca las static proxy IP addresses que aparecen en la sección Advanced settings arriba, luego selecciona la región de proxy correspondiente en Advanced settings al crear o editar la sincronización de tu sitio web y vuelve a intentar la sincronización.

4. Duplicado

  • Mensaje: “Esta página tiene el mismo contenido que otra que ya está sincronizada. Solo se incluirá una versión.”

  • Qué significa: Detectamos contenido idéntico en otro lugar, por lo que solo se conserva una copia.

5. Filtrado por palabras clave

  • Mensaje: “Las páginas con palabras clave como category, collection o tag en la URL se excluyen por defecto, ya que normalmente no contienen contenido único. Si esta página debe incluirse, contacta con soporte.”

  • Qué significa: Estas URL a menudo representan listas, no páginas de contenido independientes.

6. Código de estado 400

  • Mensaje: “No se puede encontrar el contenido de la página. Comprueba que la URL sea válida y que la página cargue sin problemas."

  • Qué significa: La URL puede estar rota o devolver un error en tu sitio web.

7. URL bloqueada

  • Mensaje: “Este domain está bloqueado para sincronizarse. Si lo necesitas, contacta con soporte.”

  • Qué significa: El domain está intencionalmente excluido de la sincronización.


​Puedes reintentar la sincronización de una página fallida pasando el cursor sobre la página, selecciona el menú de tres puntos y luego selecciona Resync.

¿Ha quedado contestada tu pregunta?