Se você quiser treinar Fin com o conteúdo do site, pode fazer isso sincronizando a URL pública desse site.
Começar
Vá para Train > Content e então selecione Website sync abaixo da seção "Add content".
Agora insira a URL pública do seu site (top-level domain) e clique em Next.
Isso buscará todas as páginas da URL do site que você fornecerá e lerá todas as páginas do sub domain.
Dicas:
Forneça o link da página inicial do seu help center externo para melhores resultados.
Use top-level domains (por exemplo, https://myhelpcenter.com em vez de https://myhelpcenter.com/articles).
Revisar páginas para sincronizar
Depois de inserir sua URL, verificaremos se ela é válida e acessível. Então você precisará revisar as páginas para sincronizar. Todas as subpáginas vinculadas em cada seção selecionada serão sincronizadas. Selecione apenas conteúdo relevante e atualizado.
Dicas:
Selecione páginas e seções que contenham conteúdo de suporte, como artigos de ajuda, guias ou FAQs.
Evite selecionar páginas de marketing, listas de produtos ou páginas com layouts complexos.
Todas as subpáginas vinculadas dentro das seções selecionadas serão incluídas automaticamente.
Você sempre pode atualizar sua seleção mais tarde nas configurações avançadas.
Configurações avançadas [opcional]
Selecione o menu suspenso Advanced settings para configurar URLs adicionais, excluir URLs, seletores CSS para excluir e mais.
URLs adicionais
As estruturas dos sites podem variar. Para garantir que sincronizemos seu conteúdo mais relevante, recomendamos adicionar URLs adicionais para essas subpáginas específicas.
Por exemplo, se você inserir https://myhelpcenter.com/help como a URL principal acima, talvez queira também adicionar a URL específica como https://myhelpcenter.com/help/index.html
URLs para excluir
Para excluir certas páginas das quais você não quer sincronizar conteúdo, você pode adicionar uma lista de globs de URL.
O que é um glob de URL?
Um glob é uma sequência de caracteres literais e/ou curingas usados para corresponder a caminhos de arquivos ou URLs. Globbing é o ato de localizar arquivos em um sistema de arquivos usando um ou mais globs. Usar globs de URL também ajuda a obter uma variedade de URLs que são quase iguais, com apenas uma pequena parte mudando entre as requisições.
Por exemplo, este glob de URL https://{store,docs}.example.com/** permite que o rastreador acesse todas as URLs que começam com https://store.example.com/ ou https://docs.example.com/ e https://example.com/**/*\?*foo=*
Dica: Não tem certeza se seu padrão glob corresponderá às URLs que deseja excluir? Você pode usar a Ferramenta Glob da DigitalOcean para testar padrões contra URLs de exemplo antes de aplicá-los. (Esta é uma ferramenta de terceiros não mantida pela Intercom.)
Seletores CSS para excluir
Para excluir certos elementos da página, você pode usar seletores CSS dessas seções ou elementos específicos que deseja excluir.
Isso é útil para pular conteúdo irrelevante da página. O valor deve ser um seletor CSS válido, aceito pela função document.querySelectorAll(). Por padrão, já removemos elementos comuns de navegação, cabeçalhos, rodapés, modais e scripts.
Nota: Imagens agora são ingeridas por padrão ao sincronizar sites. Para controlar como Fin usa imagens e GIFs nas respostas, veja Using images and GIFs in Fin AI Agent replies.
Seletor CSS clicável
Isso permite que elementos DOM identificados pelo seletor CSS sejam clicados durante o processo de sincronização web.
Isso é útil para expandir seções recolhidas, a fim de capturar seu conteúdo de texto. O valor deve ser um seletor CSS válido, aceito pela função document.querySelectorAll().
Exemplos são "[aria-expanded=\"false\"]", #expand_section
Condições complexas também podem ser descritas com um seletor CSS. No CSS, encadear seletores sem espaços cria uma condição do tipo E, por exemplo .button.blue.small corresponderá apenas a elementos com as três classes.
Usar vírgula (,) como separador funciona como OU, por exemplo .button, .blue, h1 seleciona todos os elementos com a classe button, ou a classe blue, ou cabeçalhos de primeiro nível.
Aguardar para carregar seletor CSS
Para direcionar conteúdo que pode demorar a aparecer na página, você pode adicionar um seletor CSS que fará o scraper web esperar antes de capturar o conteúdo.
Isso é útil para páginas nas quais o reconhecimento padrão de carregamento de conteúdo por rede ociosa falha. Definir essa opção desativa completamente o comportamento padrão, e a página será processada somente se o elemento especificado por esse seletor aparecer.
Nota: O valor deve ser um seletor CSS válido, aceito pela função document.querySelectorAll().
XML Sitemap
Ative o XML Sitemap para uma sincronização web mais robusta em sites que suportam sitemap, permitindo acesso a páginas que podem não ser alcançáveis pelas URLs iniciais.
Se esta opção estiver ativada, o scraper web procurará Sitemaps nos domínios da URL de origem fornecida e enfileirará URLs correspondentes de forma semelhante aos links encontrados nas páginas rastreadas. Você também pode referenciar um arquivo sitemap.xml diretamente adicionando-o como outra URL inicial, por exemplo https://www.example.com/sitemap.xml.
Região do proxy
Você pode selecionar um proxy para o rastreador usar se precisar que seu site seja rastreado com um proxy configurado para uma região ou país específico.
Atualmente suportamos os seguintes proxies:
Rotativo: Estados Unidos, Alemanha, França, Reino Unido, Chéquia, Hungria
Estático:
Estados Unidos - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135
Europa - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149
Austrália - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41
Tipo de crawler
Escolha com que profundidade o crawler renderiza cada página enquanto sincroniza este site.
Páginas sincronizadas vazias ou truncadas geralmente significam renderização JavaScript. Mude para Completo e sincronize novamente.
Completo é mais pesado, então é mais provável que coloque uma fonte grande em um cronograma reduzido.
Você pode alterar isso em uma fonte existente e sincronizar novamente para comparar.
Opção | O que faz | Use quando |
Rápido | Lê HTML sem executar JavaScript. | O conteúdo está no HTML inicial — a maioria dos blogs, docs, help centers. |
Auto (padrão) | Nós escolhemos, e mudamos para Completo se o site precisar de JavaScript. | Você não tem certeza. Certo para quase todos. |
Completo | Carrega cada página em um navegador e executa JavaScript. Mais lento. | O conteúdo só aparece depois que os scripts são executados, páginas JavaScript pesadas de apps de página única. |
Ignorar URLs canônicas
Quando ativado, o web scraper ignora as tags de link canônico (rel="canonical") e trata cada URL como uma página distinta. Esta opção está desativada por padrão.
Isso é útil quando um site aponta muitas páginas para uma URL canônica e o conteúdo está sendo perdido como resultado.
Excluindo parâmetros de consulta e respeitando robots.txt
Existem dois outros interruptores em Configurações avançadas. Ambos estão desligados por padrão.
Respeitar robots.txt: faz o crawler obedecer às regras de disallow no robots.txt do seu site. Ative para manter a sincronização consistente com o que você permite que outros crawlers alcancem. Se o robots.txt proibir caminhos que contenham conteúdo que você deseja no Fin, isso reduzirá o que é sincronizado.
Excluir parâmetros de consulta: pula qualquer URL com uma string de consulta (?). Ative quando seu site adiciona parâmetros de rastreamento, sessão ou ordenação que produzem muitas páginas quase duplicadas. Deixe desativado se conteúdo real estiver atrás de uma string de consulta, como /docs?page=intro — essas páginas também seriam puladas.
Públicos-alvo
A etapa Alvo permite definir um público padrão para todas as páginas sincronizadas e criar regras baseadas em URL para atribuir automaticamente públicos específicos com base em padrões de URL — sem necessidade de marcação manual.
Primeiro decida se o conteúdo desta fonte está habilitado para Fin AI Agent e/ou Copilot.
Então você pode definir um público Fin padrão para aplicar a todas as páginas sincronizadas desta fonte (se nenhum padrão for definido, o conteúdo padrão é Todos), ou criar regras para atribuir públicos específicos com base em padrões de URL.
Por exemplo: Se a URL contiver /uk, atribua o público do Reino Unido. As regras são avaliadas durante a sincronização, então Fin e Copilot sempre fornecem o conteúdo certo para o público certo.
Cada regra suporta três comparadores de URL:
Começa com — corresponde a URLs que começam com um prefixo dado.
Termina com — corresponde a URLs que terminam com um sufixo dado.
Contém — corresponde a URLs que contêm uma substring dada.
Nota:
Uma pré-visualização ao vivo mostra quantas páginas correspondem a cada regra, ajudando a validar as regras antes de salvar. Isso requer um sitemap disponível para sua fonte de sincronização web. Sem um sitemap, as regras ainda se aplicam, mas você não pode pré-visualizar as correspondências.
As regras são nomeadas automaticamente na criação, mas podem ser renomeadas. É aplicado um máximo de 10 regras por fonte de sincronização web.
As regras de público são apenas aditivas: elas adicionam públicos ao conteúdo, mas nunca removem atribuições existentes. Remover uma regra não desfaz suas atribuições passadas de público.
Revisar configurações de sincronização
Finalmente, revise suas configurações de sincronização e clique em Sincronizar site para começar a sincronizar o conteúdo do seu site com o Intercom.
Gerenciar fontes do site
Quando a sincronização for concluída, você receberá uma notificação por e-mail e o site aparecerá como uma fonte sincronizada em Train > Content na seção "Fontes de conteúdo".
Se você clicar em uma fonte de site, poderá visualizar e gerenciar as páginas individuais que foram sincronizadas a partir da URL pública.
Nota: Fontes de site são somente leitura e não podem ser editadas dentro do seu workspace Fin, elas devem ser editadas na fonte.
Configurar configurações
Quando você visualizar uma página do site, encontrará um painel "Detalhes" à direita que contém:
Dados: Veja o tipo de conteúdo, idioma, data de criação e última atualização (quando foi sincronizado pela última vez com a fonte).
Fin: Ativar/desativar para Fin Agent e Fin Copilot. Quando ativado, o conteúdo fica disponível para clientes e colegas, respectivamente
Agendamento: Ative ou desative o conteúdo para Fin e Copilot em datas definidas.
Público: Garanta que os clientes recebam apenas respostas e vejam conteúdo do Fin Agent relevante para eles.
Link: A URL pública para esta fonte do website.
Relatórios: Acompanha com que frequência este conteúdo é usado para resolver conversas pelo Fin Agent.
Tag: Adicione uma tag para agrupar páginas da web e manter o conteúdo organizado.
Torne disponível para Fin ou Copilot
Para tornar uma fonte de website disponível para Fin Agent ou Fin Copilot, vá para Train > Content e clique na fonte do website na seção "Content sources", depois abra a página relevante que você sincronizou.
No painel "Details" , role para baixo até “Fin” e ative:
Fin Agent - Esta configuração tornará a página da web disponível para o Fin AI usar ao responder aos clientes (respeitará quaisquer regras de público).
Fin Copilot - Esta configuração tornará a página da web disponível para o Fin Copilot usar ao responder aos colegas de equipe.
Agendar disponibilidade do website
Você pode agendar quando as páginas do website sincronizadas serão ativadas ou desativadas para Fin e Copilot, em uma data, hora e fuso horário futuros. Defina apenas a data de início ou defina data de início e fim para criar uma janela de disponibilidade limitada. O agendamento se aplica a páginas individuais ou em massa.
Agendar uma única página
Abra a página. No painel Detalhes à direita, encontre a seção Scheduling dentro do menu suspenso Fin.
Clique em Schedule availability.
No modal: selecione o produto de IA (Fin para Service ou Fin Copilot), defina a disponibilidade (Ativar ou Desativar) e escolha uma data, hora e fuso horário.
Opcionalmente, ative Set end date para adicionar uma data e hora de término — a ação será revertida automaticamente nesse momento.
Clique em Schedule para confirmar.
Agendamento em massa de páginas
Selecione várias páginas na lista de conteúdo.
Vá para o menu suspenso More actions e selecione Schedule availability.
O mesmo modal de agendamento se aplica a todos os itens selecionados.
Como o agendamento funciona
Apenas data de início: A ação de ativar/desativar ocorre no horário agendado e permanece em efeito até que você a altere manualmente.
Data de início + fim: O conteúdo é ativado (ou desativado) no horário de início e depois reverte automaticamente no horário de término.
Alterações manuais não cancelam um agendamento pendente: Se você alterar manualmente a disponibilidade após definir um agendamento, a transição agendada ainda ocorrerá no horário previsto e substituirá sua alteração manual.
Um agendamento pendente por item por agente: Definir um novo agendamento substitui o anterior — sem duplicatas.
Conteúdo excluído: Se uma página for excluída antes do agendamento ocorrer, o agendamento simplesmente não será aplicado e nenhum erro será exibido.
Torne disponível para um público específico
Você pode atribuir públicos ao conteúdo sincronizado automaticamente usando regras baseadas em URL durante a criação da sincronização web, ou manualmente por página. Primeiro, você precisará criar e definir o público que deseja segmentar.
Depois, vá para Train > Content e clique na fonte do website na seção "Content sources", depois abra a página relevante que você sincronizou.
No painel "Details" , role para baixo até “Fin” e use o menu suspenso de público para selecionar um dos seus públicos pré-definidos.
Nota:
O público padrão para URLs públicas é “Everyone”.
O Fin Agent também respeitará qualquer público que você aplicar a uma URL pública e usará este artigo para responder às perguntas dos clientes somente se eles corresponderem às regras de público.
Adicionar ou editar regras de público em sincronizações existentes
Você não precisa recriar uma sincronização para adicionar segmentação de público. Vá para Train > Content, selecione a fonte, clique no menu de configurações no canto superior direito e selecione Open settings. Navegue até a etapa Target para adicionar ou editar regras baseadas em URL.
Nota: Quando regras de público são adicionadas a uma sincronização web existente, elas se aplicam retroativamente a todo o conteúdo já ingerido dessa fonte — não apenas ao conteúdo novo daqui para frente.
Re-sincronizar ou remover um website como fonte
Se você quiser re-sincronizar ou remover uma URL pública como fonte, vá para Train > Content e clique na fonte do website na seção "Content sources", depois abra o menu Settings no canto superior direito.
Aqui, você pode selecionar se deseja Re-sync ou Remove this source.
Dica: Atualizações feitas no seu website fonte não aparecerão imediatamente no Intercom. As re-sincronizações do website acontecem automaticamente toda semana, mas você pode acionar uma re-sincronização manual a qualquer momento para mostrar o conteúdo mais recente mais rápido.
Ver histórico de sincronização do website
Você pode ver uma lista das sincronizações passadas do website para saber quando foram executadas pela última vez, quais páginas foram encontradas e quaisquer páginas com falha. Vá para Train > Content e clique na fonte do website na seção "Content sources", depois selecione View sync history.
Cada linha na tabela representa uma execução passada ou ativa, e você pode filtrar as execuções por status (iniciada, sucesso, falha).
Inclui as seguintes informações:
Data da sincronização
Status
Páginas sincronizadas
Páginas excluídas
Páginas com falha
Duração
Sincronização iniciada por
Se uma sincronização falhar, você pode passar o mouse sobre o status para ver uma explicação detalhada do motivo.
As sincronizações automáticas pausam quando Fin não está usando um site
Uma nova fonte sincroniza conforme o cronograma nos primeiros 90 dias, independentemente. Depois disso, continua sincronizando automaticamente se alguma das condições for verdadeira:
Uma página dela foi usada em uma resposta do Fin nos últimos 90 dias.
Caso contrário, as sincronizações agendadas pausam.
Quando pausado: as páginas permanecem no seu Knowledge Hub e continuam disponíveis para Fin e Copilot (nada é excluído). Apenas a nova varredura para, então as edições no seu site não serão captadas.
Para restaurar: O botão Sync now atualiza o conteúdo uma vez, mas não reinicia o cronograma. A sincronização automática retoma sozinha assim que Fin usar a fonte novamente.
Sites que são pesados para rastrear sincronizam com menos frequência
Sites muito grandes e sites que precisam de renderização completa em JavaScript custam muito mais para rastrear. Quando uma fonte se mostra pesada em recursos, mudamos o cronograma de semanal para a cada 14 dias.
Isso acontece automaticamente, por fonte. Para manter um site grande em um cronograma mais rápido, restrinja o rastreamento usando exclusões de URL ou adicione subpáginas específicas em vez de um domínio inteiro.
Solução de problemas na sincronização do site
Problemas comuns
Ao importar conteúdo do site para habilitar o Fin, você precisa inserir a URL pública. Isso buscará todas as páginas aninhadas sob essa URL e as sincronizará para uso do Fin AI Agent.
Se o importador não retornou o número de páginas esperado, há algumas razões...
A URL fornecida não é o domínio de nível superior
A sincronização do site funciona indo até a URL que você fornece e buscando todas as páginas aninhadas sob essa URL. Essas páginas devem ter o mesmo padrão de URL que a URL fornecida.
Por exemplo, se o domínio de nível superior for https://myhelpcenter.com/home, então todas as páginas que você deseja importar devem incluir o prefixo /home na URL, por exemplo, https://myhelpcenter.com/home/article. Se não incluírem, remova o prefixo e use o tronco de URL mais básico, por exemplo, https://myhelpcenter.com, e tente importar novamente.
A URL é privada
Se o conteúdo que você quer usar estiver atrás de um login, Fin não poderá acessá-lo ou importá-lo.
Limites de páginas
A sincronização do site tem dois limites:
Domínios: você pode sincronizar até 100 domínios de nível superior diferentes.
Páginas por fonte: Fin sincroniza no máximo 4.000 páginas de cada fonte.
Uma sincronização também pode falhar se uma única página contiver uma quantidade muito grande de conteúdo. Você será notificado por e-mail sempre que uma sincronização falhar.
Nota:
Se uma fonte tiver mais de 4.000 páginas, divida-a em várias fontes para que cada uma fique abaixo do limite:
Divida o site em seções menores e adicione cada seção como uma fonte própria.
Sincronize caminhos de URL diferentes separadamente, por exemplo, uma fonte por área de produto ou categoria.
Isso mantém cada fonte abaixo do limite de páginas e reduz o conteúdo processado por sincronização.
Sites restritos a IPs regionais específicos
A sincronização de sites do Fin (usada para adicionar URLs públicas para Fin AI Agent e Copilot) não usa uma string de agente de usuário dedicada e personalizada neste momento.
Se seu site tem proteção anti-rastreamento rigorosa, você pode usar um proxy estático para permitir uma lista fixa de endereços IP e garantir que seu conteúdo seja ingerido. Selecione um proxy estático em Configurações avançadas ao criar ou editar sua sincronização de site.
Por endereço IP: Se seu site requer lista de permissões, selecione um proxy estático em Configurações avançadas — isso fornece um conjunto fixo de IPs para adicionar à sua lista de permissões.
Essas solicitações são usadas apenas para sincronização de sites. Elas não afetam o tráfego do Messenger ou o rastreamento do usuário final.
Páginas de sites não ingleses ou internacionais não estão sincronizando
Se seu sitemap inclui URLs com caracteres não ASCII (como letras acentuadas ou scripts como chinês ou árabe), algumas dessas páginas podem não sincronizar como esperado. A descoberta do sitemap agora suporta essas URLs, mas ainda podem ocorrer problemas em outras partes do processo de sincronização. Tente sincronizar manualmente para resolver. Se as páginas ainda estiverem faltando, contate o suporte.
Erros na sincronização do site
Quando você sincroniza conteúdo do site, pode ver diferentes status que indicam o que aconteceu durante o processo. Para ver o status da sincronização do seu site, vá para Train > Content e selecione a fonte do site, depois use o menu suspenso Status para filtrar por:
Sincronizando
Ativo
Falhou
Excluído
Aqui está o que cada um significa e o que você pode fazer a seguir:
Sincronizando
A sincronização da página ainda está em andamento. Uma sincronização inicial pode levar de alguns minutos a mais de uma hora, dependendo da quantidade de conteúdo que você tem.
Ativo
A página foi sincronizada com sucesso e pode ser ativada para Fin e Copilot.
Nota: Uma sincronização bem-sucedida nem sempre significa que conseguimos extrair todo o conteúdo da página. Se quiser confirmar a cobertura completa, recomendamos visualizar Fin com as respostas que espera encontrar nessa página.
Excluído
Essas páginas não são sincronizadas intencionalmente porque você as excluiu nas Configurações avançadas de sincronização. Elas não podem ser tentadas novamente ou incluídas, a menos que especificado o contrário.
Falhou
Esses erros significam que a sincronização não foi concluída e podem exigir alterações do seu lado antes de tentar novamente:
1. Erro desconhecido
Mensagem: “Esta página não pôde ser acessada. Pode estar lenta ou bloqueada. Tente sincronizar novamente ou entre em contato com o suporte se falhar.”
O que significa: Algo nos impediu de acessar a página, mas a causa não está clara.
2. Sessão bloqueada / Limite de taxa
Mensagem: “O site está nos impedindo de acessar seu conteúdo. Verifique se está sendo bloqueado por uma configuração anti-crawler ou firewall. Verifique a configuração do seu site e tente sincronizar novamente. Se o problema persistir, entre em contato com o suporte.”
O que significa: Seu site está bloqueando ou limitando ativamente nosso crawler.
3. Erros de rede, tempo limite ou similares
Mensagem: “Esta página não pôde ser acessada. Pode estar lenta para carregar ou bloqueada por configurações anti-crawler ou firewall. Verifique a configuração do seu site e tente sincronizar novamente. Se o problema persistir, entre em contato com o suporte.”
O que significa: A página não carregou a tempo ou não pôde ser alcançada devido a problemas de rede ou bloqueio.
O que fazer: Um erro de "Tempo limite de navegação" é frequentemente causado por proteção contra bots ou software de segurança no seu site bloqueando o crawler do Intercom. Para resolver isso, coloque na lista branca os endereços IP proxy estáticos listados na seção Configurações avançadas acima, selecione a região proxy correspondente em Configurações avançadas ao criar ou editar a sincronização do seu site e tente sincronizar novamente.
4. Duplicado
Mensagem: “Esta página tem o mesmo conteúdo que outra que já está sincronizada. Apenas uma versão será incluída.”
O que significa: Detectamos conteúdo idêntico em outro lugar, então apenas uma cópia é mantida.
5. Filtragem por palavra-chave
Mensagem: “Páginas com palavras-chave como category, collection ou tag na URL são excluídas por padrão, pois geralmente não contêm conteúdo único. Se esta página deve ser incluída, entre em contato com o suporte.”
O que significa: Essas URLs geralmente representam listas, não páginas de conteúdo independentes.
6. Código de status 400
Mensagem: “O conteúdo da página não pode ser encontrado. Verifique se a URL é válida e se a página carrega sem problemas.”
O que significa: A URL pode estar quebrada ou retornando um erro no seu site.
7. URL bloqueada
Mensagem: “Este domain do website está bloqueado para sincronização. Se precisar disso, entre em contato com o suporte.”
O que significa: O domain está intencionalmente excluído da sincronização.
Você pode tentar sincronizar novamente uma página que falhou passando o mouse sobre ela, selecionando o menu de três pontos e depois escolhendo Resincronizar.






















