Passar para o conteúdo principal

Sincronizar e gerenciar sites

Como treinar Fin em URLs públicas do seu site.

Se você quiser treinar o Fin com conteúdo do site, pode fazer isso sincronizando a URL pública desse site.


Começar

Vá para Train > Content e então selecione Website sync abaixo da seção "Add content".

Agora insira a URL pública do seu site (top-level domain) e clique em Next.

Isso buscará todas as páginas a partir da URL do site que você fornecer e lerá todas as páginas de sub domain.

Dicas:

Revisar páginas para sincronizar

Depois de inserir sua URL, verificaremos se ela é válida e acessível. Em seguida, você precisará revisar as páginas para sincronizar. Todas as sub-páginas vinculadas em cada seção selecionada serão sincronizadas. Selecione apenas conteúdo relevante e atualizado.

Dicas:

  • Selecione páginas e seções que contenham conteúdo de suporte, como artigos de ajuda, guias ou FAQS.

  • Evite selecionar páginas de marketing, listas de produtos ou páginas com layouts complexos.

  • Todas as sub-páginas vinculadas dentro das seções selecionadas serão incluídas automaticamente.

  • Você sempre pode atualizar sua seleção mais tarde nas configurações avançadas.

Configurações avançadas [opcional]

Selecione o menu suspenso Advanced settings para configurar URLs adicionais, excluir URLs, seletores CSS para excluir e mais.

URLs adicionais

As estruturas de site podem variar. Para garantir que sincronizemos seu conteúdo mais relevante, recomendamos que você adicione URLs adicionais para essas subpáginas específicas.

Por exemplo, se você inserir https://myhelpcenter.com/help como a URL principal acima, talvez também queira adicionar a URL específica como https://myhelpcenter.com/help/index.html

URLs para excluir

Para excluir determinadas páginas das quais você não deseja sincronizar conteúdo, você pode adicionar uma lista de globs de URL.

O que é um glob de URL?

Um glob é uma sequência de caracteres literais e/ou curingas usada para corresponder caminhos de arquivos ou URLs. Globbing é o ato de localizar arquivos em um sistema de arquivos usando um ou mais globs. Usar globs de URL também ajuda a obter uma gama de URLs que são em sua maioria iguais, com apenas uma pequena parte mudando entre as requisições.

Por exemplo, este glob de URL https://{store,docs}.example.com/** permite que o crawler acesse todas as URLs começando com https://store.example.com/ ou https://docs.example.com/ e https://example.com/**/*\?*foo=*

Dica: Não tem certeza se seu padrão glob corresponderá às URLs que você quer excluir? Você pode usar a Ferramenta de Glob da DigitalOcean para testar padrões contra URLs de exemplo antes de aplicá-los. (Esta é uma ferramenta de terceiros não mantida pela Intercom.)

Seletores CSS para excluir

Para excluir certos elementos da página, você pode usar seletores CSS dessas seções ou elementos específicos que deseja excluir.

Isso é útil para pular conteúdo irrelevante da página. O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll(). Por padrão, já removemos elementos comuns de navegação, cabeçalhos, rodapés, modais, scripts e imagens inline.

Seletor CSS clicável

Isso permite que elementos DOM identificados pelo seletor CSS sejam clicados durante o processo de sincronização web.

Isso é útil para expandir seções recolhidas, a fim de capturar seu conteúdo de texto. O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll().

Exemplos são "[aria-expanded=\"false\"]", #expand_section

Condições complexas também podem ser descritas com um seletor CSS. Em CSS, encadear seletores sem espaços cria uma condição semelhante a AND, por exemplo .button.blue.small corresponderá apenas a elementos com as três classes.

Usar vírgula (,) como separador funciona como OR, por exemplo .button, .blue, h1 seleciona todos os elementos com a classe button, ou a classe blue, ou cabeçalhos de primeiro nível.

Aguardar carregamento do seletor CSS

Para direcionar conteúdo que pode ter atraso ao aparecer na página, você pode adicionar um seletor CSS que fará o web scraper esperar antes de raspar o conteúdo.

Isso é útil para páginas nas quais o reconhecimento padrão de carregamento de conteúdo por rede ociosa falha. Definir esta opção desativa completamente o comportamento padrão, e a página será processada apenas se o elemento especificado por este seletor aparecer.

Observação: O valor deve ser um seletor CSS válido aceito pela função document.querySelectorAll().

XML Sitemap

Habilite o XML Sitemap para uma sincronização web mais robusta em sites que suportam sitemap, permitindo acessar páginas que podem não ser alcançáveis a partir das URLs iniciais.

Se esta opção estiver habilitada, o web scraper procurará Sitemaps nos domínios da URL de origem fornecida e enfileirará URLs correspondentes de forma semelhante aos links encontrados nas páginas rastreadas. Você também pode referenciar um arquivo sitemap.xml diretamente adicionando-o como outra Start URL, por exemplo https://www.example.com/sitemap.xml.

Região do proxy

Você pode selecionar um proxy para o crawler usar se requerer que seu site seja rastreado com um proxy configurado para uma região ou país específico.

Atualmente suportamos os seguintes proxies:

  • Rotativo: United States, Germany, France, United Kingdom, Czechia, Hungary

  • Estático:

    • United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • Austrália - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

Tipo de rastreador

Escolha com que profundidade o rastreador renderiza cada página ao sincronizar este site.

  • Páginas sincronizadas vazias ou truncadas geralmente significam renderização em JavaScript. Mude para Full e reinsira a sincronização.

  • Full é mais pesado, então é mais provável que coloque uma fonte grande em uma programação reduzida.

  • Você pode alterar isso em uma fonte existente e reinscrever para comparar.

Opção

O que faz

Quando usar

Rápido

Lê HTML sem executar JavaScript.

O conteúdo está no HTML inicial — a maioria dos blogs, docs, help center.

Auto (padrão)

Nós escolhemos, e mudamos para Full se o site precisar de JavaScript.

Você não tem certeza. Certo para quase todos.

Full

Carrega cada página em um navegador e executa JavaScript. Mais lento.

O conteúdo só aparece depois que os scripts são executados, aplicativos de página única páginas pesadas em JavaScript.

Ignorar URLs canônicos

Quando ativado, o web scraper ignora tags de link canônico (rel3D"canonical") e trata cada URL como uma página distinta. Esta opção está desativada por padrão.

Isso é útil quando um site aponta muitas páginas para uma URL canônica e o conteúdo está sendo perdido como resultado.

Excluindo parâmetros de consulta e respeitando robots.txt

Existem mais duas alternâncias em Configurações avançadas. Ambas estão desativadas por padrão.

Respeitar robots.txt: faz com que o rastreador obedeça as regras disallow no robots.txt do seu site. Ative para manter a sincronização consistente com o que você permite que outros rastreadores alcancem. Se robots.txt negar caminhos que contêm conteúdo que você deseja em Fin, isso reduzirá o que é sincronizado.

Excluir parâmetros de consulta: pula qualquer URL com string de consulta (?). Ative quando seu site adiciona parâmetros de rastreamento, sessão ou ordenação que produzem muitas páginas quase duplicadas. Deixe desativado se conteúdo real estiver atrás de uma string de consulta, como /docs?page3Dintro — essas páginas também seriam puladas.

Públicos-alvo

A etapa Target permite definir um público padrão para todas as páginas sincronizadas e criar regras baseadas em URL para atribuir automaticamente públicos específicos com base em padrões de URL — sem necessidade de marcação manual.

Primeiro decida se o conteúdo desta fonte está habilitado para Fin AI Agent e/ou Copilot.

Então você pode definir um público Fin padrão para aplicar a todas as páginas sincronizadas desta fonte (se nenhum padrão for definido, o conteúdo terá como padrão Everyone), ou criar regras para atribuir públicos específicos com base em padrões de URL.

Por exemplo: Se a URL contiver /uk, atribua o público UK. As regras são avaliadas durante a sincronização, então Fin e Copilot sempre servem o conteúdo certo para o público certo.

Cada regra suporta três comparadores de URL:

  • Começa com — corresponde a URLs que começam com um prefixo dado.

  • Termina com — corresponde a URLs que terminam com um sufixo dado.

  • Contém — corresponde a URLs que contêm uma substring dada.

Observação:

  • Uma visualização ao vivo mostra quantas páginas correspondem a cada regra, ajudando a validar regras antes de salvar. Isso requer um sitemap disponível para sua fonte de sincronização web. Sem um sitemap, as regras ainda se aplicam, mas você não pode visualizar correspondências.

  • As regras são nomeadas automaticamente na criação, mas podem ser renomeadas. É aplicado um máximo de 10 regras por fonte de sincronização web.

  • As regras de público são apenas aditivas: elas adicionam públicos ao conteúdo, mas nunca removem atribuições existentes. Remover uma regra não desfaz suas atribuições de público passadas.

Revisar configurações de sincronização

Por fim, revise suas configurações de sincronização e clique em Sync website para começar a sincronizar o conteúdo do seu site com o Intercom.


Gerenciar fontes do site

Uma vez que a sincronização esteja completa, você receberá uma notificação por e-mail e o site aparecerá como uma fonte sincronizada em Train > Content na seção "Content sources".

Se você clicar em uma fonte do site, pode visualizar e gerenciar as páginas individuais que foram sincronizadas a partir da URL pública.

Observação: Fontes do site são somente leitura e não podem ser editadas dentro do seu workspace Fin, elas devem ser editadas na fonte.

Configurar configurações

Quando você visualizar uma página do site, encontrará um painel "Detalhes" à direita que contém:

  • Dados: Veja o tipo de conteúdo, idioma, data de criação e última atualização (quando foi sincronizado pela última vez com a fonte).

  • Fin: Ativar/desativar para Fin Agent e Fin Copilot. Quando ativado, o conteúdo fica disponível para clientes e colegas, respectivamente

    • Agendamento: Ative ou desative o conteúdo para Fin e Copilot em datas definidas.

    • Audience: Garanta que os clientes recebam apenas respostas e vejam conteúdo do Fin Agent que seja relevante para eles.

  • Link: A URL pública desta origem do site.

  • Reports: Acompanha com que frequência este conteúdo está envolvido e é usado para resolver conversas pelo Fin Agent .

  • Tag: Adicione uma etiqueta para agrupar páginas da web e manter o conteúdo organizado.

Tornar disponível para Fin ou Copilot

Para tornar uma origem de site disponível para Fin Agent ou Fin Copilot, vá para Train > Content e clique na origem do site na seção "Content sources", depois abra a página relevante que você sincronizou.

Do painel "Details" , role a página até “Fin” e ative o interruptor:

  • Fin Agent - Essa configuração tornará a página disponível para o Fin AI usar ao responder clientes (respeitará quaisquer audience rules).

  • Fin Copilot - Essa configuração tornará a página disponível para o Fin Copilot usar ao responder colegas de equipe.

Agendar disponibilidade do site

Você pode agendar quando páginas sincronizadas do site serão ativadas ou desativadas para Fin e Copilot, em uma data, hora e fuso horário futuros. Defina apenas uma data de início, ou defina início e término para criar uma janela de disponibilidade limitada. O agendamento se aplica a páginas individuais ou em massa.

Agendar uma única página

  1. Abra a página. No painel Details à direita, encontre a seção Scheduling dentro do menu Fin.

  2. Clique em Schedule availability.

  3. No modal: selecione o produto de IA (Fin for Service ou Fin Copilot), defina a disponibilidade (Enable ou Disable) e escolha uma data, hora e fuso horário.

  4. Opcionalmente ative Set end date para adicionar uma data e hora de término — a ação se reverte automaticamente nesse momento.

  5. Clique em Schedule para confirmar.

Agendar páginas em massa

  1. Selecione várias páginas na lista de conteúdo.

  2. Vá ao menu suspenso More actions e selecione Schedule availability.

  3. O mesmo modal de agendamento se aplica a todos os itens selecionados.

Como o agendamento funciona

  • Start date only: A ação de ativar/desativar ocorre na hora agendada e permanece em vigor até que você a altere manualmente.

  • Start + end date: O conteúdo é ativado (ou desativado) na hora de início e então reverte automaticamente na hora de término.

  • Manual changes don't cancel a pending schedule: Se você alternar a disponibilidade manualmente após definir um agendamento, a transição agendada ainda ocorrerá na hora prevista e substituirá sua alteração manual.

  • One pending schedule per item per agent: Definir um novo agendamento substitui o anterior — sem duplicatas.

  • Deleted content: Se uma página for excluída antes do disparo do agendamento, o agendamento simplesmente não será aplicado e nenhum erro será exibido.

Tornar disponível para um público específico

Você pode atribuir públicos ao conteúdo sincronizado automaticamente usando regras baseadas em URL durante a criação da sincronização web, ou manualmente por página. Primeiro, você precisará criar e definir o público que deseja segmentar.

Em seguida, vá para Train > Content e clique na origem do site na seção "Content sources", depois abra a página relevante que você sincronizou.

Do painel "Details" , role até “Fin” e use o menu de público para selecionar um dos seus públicos pré-definidos.

Note:

  • O público padrão para URLs públicas é “Everyone”.

  • Fin Agent também respeitará qualquer público que você aplicar a uma URL pública e só usará este artigo para responder perguntas de clientes se eles corresponderem às regras de público.

Adicionar ou editar regras de público em sincronizações existentes

Você não precisa recriar uma sincronização para adicionar segmentação de público. Vá para Train > Content, selecione a origem, clique no menu de configurações no canto superior direito e selecione Open settings. Navegue até a etapa Target para adicionar ou editar regras baseadas em URL.

Note: Quando regras de público são adicionadas a uma sincronização web existente, elas se aplicam retroativamente a todo o conteúdo já ingerido dessa origem — não apenas ao conteúdo novo que vier a seguir.

Re-sincronizar ou remover um site como origem

Se você quiser re-sincronizar ou remover uma URL pública como origem, vá para Train > Content, e clique na origem do site na seção "Content sources", depois abra o menu Settings no canto superior direito.

Aqui, você pode escolher se deseja Re-sync ou Remove this source.

Tip: As atualizações feitas no seu site de origem não aparecerão no Intercom imediatamente. As re-sincronizações do site acontecem automaticamente a cada semana, mas você pode acionar uma re-sincronização manual a qualquer momento para mostrar o conteúdo mais recente mais cedo.

Ver histórico de sincronização do site

Você pode ver uma lista de sincronizações passadas para ver quando foram executadas por último, quais páginas foram encontradas e quaisquer páginas que falharam. Vá para Train > Content, e clique na origem do site na seção "Content sources", depois selecione View sync history.


Cada linha na tabela representa uma execução passada ou ativa, e você pode filtrar as execuções por status (started, success, failed).

Inclui as seguintes informações:

  • Data da sincronização

  • Status

  • Páginas sincronizadas

  • Páginas excluídas

  • Páginas com falha

  • Duração

  • Sincronização iniciada por

Se uma sincronização falhar, você pode passar o cursor sobre o status para ver uma explicação detalhada do motivo.

Sincronizações automáticas pausam quando Fin não está usando um site

Uma nova fonte sincroniza conforme o cronograma pelos primeiros 90 dias independentemente. Depois disso, continua sincronizando automaticamente se uma das condições for verdadeira:

  • Uma página dela foi usada em uma resposta do Fin nos últimos 90 dias.

Caso contrário, as sincronizações agendadas pausam.

Quando pausado: as páginas permanecem no seu Knowledge Hub e continuam disponíveis para Fin e Copilot (nada é excluído). Somente a re-varredura é interrompida, portanto alterações no seu site não serão captadas.

Para restaurar: O botão Sync now atualiza o conteúdo uma vez, mas não reinicia o agendamento. A sincronização automática retoma sozinha assim que Fin usar a fonte novamente.

Sites que são pesados para rastrear sincronizam com menos frequência

Sites muito grandes, e sites que precisam de renderização completa de JavaScript, custam muito mais para rastrear. Quando uma fonte se mostra com alto uso de recursos, nós a movemos de semanal para um cronograma de a cada 14 dias.

Isso acontece automaticamente, por fonte. Para manter um site grande em um cronograma mais rápido, restrinja o rastreamento usando exclusões de URL, ou adicione subpáginas específicas em vez de todo o domain.


Solução de problemas da sincronização de sites

Problemas comuns

Ao importar conteúdo de site para habilitar o Fin, você precisa inserir a URL pública. Isso vai procurar por todas as páginas aninhadas sob essa URL e sincronizá-las para uso do Fin AI Agent.

Se o importador não retornou o número de páginas que você esperava, existem algumas razões...

A URL fornecida não é o top level domain

A sincronização de sites funciona indo até a URL que você fornece e então procurando por todas as páginas aninhadas sob essa URL. Essas páginas devem ter o mesmo padrão de URL que a URL fornecida.

Por exemplo, se o top level domain for https://myhelpcenter.com/home, então todas as páginas que você deseja importar devem incluir o prefixo /home na URL, por exemplo https://myhelpcenter.com/home/article. Se não incluírem, remova o prefixo e use o tronco de URL mais básico, por exemplo https://myhelpcenter.com, e tente importar novamente.

A URL é privada

Se o conteúdo que você quer usar estiver atrás de um login, Fin não conseguirá acessá-lo nem importá-lo.

Limites de páginas

A sincronização de sites tem dois limites:

  • Domains: você pode sincronizar até 100 diferentes top-level domains.

  • Pages per source: Fin sincroniza no máximo 4.000 páginas de cada fonte.

Uma sincronização também pode falhar se uma única página contiver uma quantidade muito grande de conteúdo. Você será notificado por e-mail sempre que uma sincronização falhar.

Observação:

  • Se uma fonte tiver mais de 4.000 páginas, divida-a em várias fontes para que cada uma fique abaixo do limite:

    • Particione o site em seções menores e adicione cada seção como sua própria fonte.

    • Sincronize caminhos de URL diferentes separadamente, por exemplo, uma fonte por área de produto ou categoria.

  • Isso mantém cada fonte abaixo do limite de páginas e reduz o conteúdo processado por sincronização.

Sites restritos a IPs regionais específicos

A sincronização de sites do Fin (usada para adicionar URLs públicas para Fin AI Agent e Copilot) não utiliza uma string de user-agent dedicada e customizada no momento.

Se seu site tiver proteção anti-rastreamento rigorosa, você pode usar um static proxy para permitir a lista de um conjunto fixo de endereços IP e garantir que seu conteúdo seja ingerido. Selecione um static proxy em Advanced settings ao criar ou editar sua sincronização de site.

  • Por endereço IP: Se seu site requer allow-listing, selecione um static proxy em Advanced settings — isso fornece um conjunto fixo de IPs para adicionar à sua allow-list.

  • Essas solicitações são usadas somente para sincronização de sites. Elas não afetam seu tráfego do Messenger ou o rastreamento de usuários finais.

Páginas de sites não ingleses ou internacionais não estão sincronizando

Se seu sitemap incluir URLs com caracteres não ASCII (como letras acentuadas, ou escritas como chinês ou árabe) algumas dessas páginas podem não sincronizar como esperado. A descoberta de sitemaps agora suporta essas URLs, mas elas ainda podem encontrar problemas em outras partes do processo de sincronização. Tente ressintcronizar manualmente para resolver. Se páginas ainda estiverem faltando, contate o suporte.

Erros de sincronização de sites

Ao sincronizar conteúdo de site, você pode ver status diferentes que indicam o que aconteceu durante o processo. Para ver o status da sincronização do seu site vá para Train > Content e selecione a fonte do site, então use o menu Status para filtrar por:

  • Sincronizando

  • Ao vivo

  • Falhou

  • Excluído

Isto é o que cada um significa e o que você pode fazer a seguir:

Sincronizando

A sincronização de páginas ainda está em andamento. Uma sincronização inicial pode levar de alguns minutos a mais de uma hora dependendo de quanto conteúdo você tem.

Ao vivo

A página foi sincronizada com sucesso e pode ser habilitada para Fin e Copilot.

Observação: Uma sincronização bem-sucedida nem sempre significa que conseguimos raspar todo o conteúdo da página. Se você quiser confirmar a cobertura completa, recomendamos previsualizar o Fin com respostas que você espera que ele encontre nessa página.

Excluído

Essas páginas não são sincronizadas intencionalmente porque você as excluiu em Advanced sync settings. Elas não podem ser reenviadas nem incluídas a menos que especificado o contrário.

Falhou

Esses erros significam que a sincronização não foi concluída e podem exigir alterações da sua parte antes de tentar novamente:

1. Erro desconhecido

  • Message: “Esta página não pôde ser acessada. Ela pode estar lenta ou bloqueada. Tente sincronizar novamente ou entre em contato com o suporte se falhar.”

  • O que significa: Algo impediu que acessássemos a página, mas a causa não está clara.

2. Sessão bloqueada / Limite de taxa

  • Message: “O site está nos impedindo de acessar seu conteúdo. Verifique se ele está sendo bloqueado por uma configuração anti-crawler ou firewall. Verifique a configuração do seu site e tente sincronizar novamente. Se o problema persistir, entre em contato com o suporte.”

  • O que significa: Seu site está bloqueando ou limitando ativamente nosso crawler.

3. Erros de rede, tempo esgotado ou similares

  • Message: “Esta página não pôde ser acessada. Pode demorar a carregar ou estar bloqueada por configurações anti-crawler ou por um firewall. Verifique a configuração do seu site e tente sincronizar novamente. Se o problema persistir, entre em contato com o suporte.”

  • O que significa: A página não carregou a tempo ou não pôde ser alcançada devido a problemas de rede ou bloqueio.

    O que fazer: Um erro de "Navigation timeout" costuma ser causado por proteção contra bots ou software de segurança no seu site bloqueando o crawler da Intercom. Para resolver, coloque na lista branca os static proxy IP addresses listados na seção Advanced settings acima, em seguida selecione a região de proxy correspondente em Advanced settings ao criar ou editar sua sincronização de site e tente novamente.

4. Duplicado

  • Message: “Esta página tem o mesmo conteúdo que outra que já está sincronizada. Apenas uma versão será incluída.”

  • O que significa: Detectamos conteúdo idêntico em outro lugar, então apenas uma cópia é mantida.

5. Filtragem por palavra-chave

  • Message: “Páginas com palavras-chave como category, collection ou tag na URL são excluídas por padrão, pois normalmente não contêm conteúdo exclusivo. Se esta página deve ser incluída, entre em contato com o suporte.”

  • O que significa: Essas URLs frequentemente representam listas, não páginas de conteúdo independentes.

6. Código de status 400

  • Message: “O conteúdo da página não pode ser encontrado. Verifique se a URL é válida e se a página carrega sem problemas.”

  • O que significa: A URL pode estar quebrada ou retornando um erro no seu site.

7. URL bloqueada

  • Message: “Este domain está bloqueado para sincronização. Se você precisar disso, entre em contato com o suporte.”

  • O que significa: The domain is intentionally excluded from syncing.


​Você pode reenviar uma sincronização de página com falha passando o mouse sobre a página, selecionando o menu de três pontos e então Resync.

Respondeu à sua pergunta?