メインコンテンツにスキップ

ウェブサイトを同期して管理する

Webサイトの公開URLからFinをトレーニングする方法。

WebサイトのコンテンツでFinをトレーニングしたい場合は、そのサイトの公開URLを同期することで行えます。


開始する

Train > Contentに移動し、"Add content"セクションの下にあるWebsite sync を選択します。

サイトの公開URL(トップレベル domain)を入力し、Next.をクリックします。

指定したウェブサイトのURLからすべてのページを取得し、すべてのサブ domain ページを読み取ります。

ヒント:

同期するページを確認する

URLを入力すると、それが有効でアクセス可能かを確認します。次に、同期するページを確認する必要があります。選択した各セクションにリンクされたすべてのサブページが同期されます。関連性のある最新のコンテンツのみを選択してください。

ヒント:

  • ヘルプ記事、ガイド、FAQのようなサポートコンテンツを含むページやセクションを選択してください。

  • マーケティングページ、製品一覧、または複雑なレイアウトのページは選択しないでください。

  • 選択したセクション内のすべてのリンクされたサブページは自動的に含まれます。

  • 詳細設定でいつでも選択を更新できます。

詳細設定 [オプション]

追加のURL、除外するURL、除外するCSSセレクタなどを設定するには、Advanced settings のドロップダウンを選択します。

追加のURL

ウェブサイトの構造は様々です。最も関連性の高いコンテンツを同期するために、特定のサブページ用の追加URLを追加することをおすすめします。

例えば、上でプライマリURLにhttps://myhelpcenter.com/helpを入力した場合、https://myhelpcenter.com/help/index.htmlのような特定のURLを追加することも検討してください。

除外するURL

同期したくないページを除外するには、URLグロブのリストを追加できます。

URLグロブとは何ですか?

グロブはファイルパスやURLに一致させるために使われるリテラル文字やワイルドカードを含む文字列です。グロブを使ってファイルシステム上のファイルを見つけます。URLグロブを使うと、ほとんど同じで一部だけが変わるURLの範囲を取得できます。

例えば、このURLグロブ https://{store,docs}.example.com/** は、クローラーが https://store.example.com/ または https://docs.example.com/ で始まるすべてのURLにアクセスできるようにします。また https://example.com/**/*\?*foo=* も例です。

ヒント: 除外したいURLに対してグロブパターンがマッチするかどうかわからない場合は、適用する前にサンプルURLでパターンをテストするためにDigitalOcean's Glob Toolを使用できます。 (これはIntercomが保守するサードパーティ製ツールです。)

除外するCSSセレクタ

特定のページ要素を除外するには、除外したい特定のセクションや要素のCSSセレクタを使用できます。

これは関連性の低いページコンテンツをスキップするのに便利です。値はdocument.querySelectorAll()で受け入れられる有効なCSSセレクタでなければなりません。デフォルトでは、一般的なナビゲーション要素、ヘッダー、フッター、モーダル、スクリプト、およびインライン画像は既に削除されます。

クリック可能なCSSセレクタ

これは、web syncプロセス中にCSSセレクタで識別されるDOM要素をクリックできるようにします。

折りたたまれたセクションを展開してそのテキストコンテンツを取得するのに役立ちます。値はdocument.querySelectorAll()で受け入れられる有効なCSSセレクタでなければなりません。

例:"[aria-expanded=\"false\"], #expand_section

複雑な条件はCSSセレクタで記述することもできます。CSSではセレクタをスペースなしで連結するとANDのような条件になります。例えば.button.blue.smallは3つすべてのクラスを持つ要素にのみ一致します。

区切りにカンマ(,)を使用するとORのように機能します。例えば.button, .blue, h1はクラスbuttonまたはclass blue、あるいは一階見出しを対象にします。

読み込みを待つCSSセレクタ

ページに遅延して表示される可能性があるコンテンツをターゲットにするには、webスクレイパーがスクレイピングの前に待機するCSSセレクタを追加できます。

これは、デフォルトのアイドルネットワークによるコンテンツ読み込み認識が失敗するページに便利です。このオプションを設定するとデフォルトの動作は完全に無効になり、このセレクタで指定した要素が出現した場合にのみページが処理されます。

注意: 値はdocument.querySelectorAll()で受け入れられる有効なCSSセレクタでなければなりません。

XMLサイトマップ

サイトマップ対応サイトでより堅牢なwebsyncを行うためにXMLサイトマップを有効にすると、初期のURLから到達できないページへのアクセスが可能になります。

このオプションが有効な場合、webスクレイパーは提供されたソースURLのドメインでサイトマップを探し、クロールしたページで見つかったリンクと同様に一致するURLをキューに入れます。sitemap.xmlファイルを別のStart URLとして直接参照することもできます。例:https://www.example.com/sitemap.xml

プロキシ地域

ウェブサイトを特定の地域や国に設定されたプロキシでクロールする必要がある場合、クローラーが使用するプロキシを選択できます。

現在サポートしているプロキシ:

  • ローテーティング: United States, Germany, France, United Kingdom, Czechia, Hungary

  • スタティック:

    • United States - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • ヨーロッパ - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • オーストラリア - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

クローラーの種類

このウェブサイトを同期するときに、クローラーが各ページをどの程度詳細にレンダリングするかを選択します。

  • ページが空または切り詰められて同期される場合、通常はJavaScriptのレンダリングが原因です。Fullに切り替えて再同期してください。

  • Fullは処理が重くなるため、大きなソースを短いスケジュールにする可能性が高くなります。

  • 既存のソースでこれを変更して再同期し、比較することができます。

オプション

これが行うこと

使用する場合

高速

JavaScriptを実行せずにHTMLを読み取ります。

コンテンツが初期HTMLに含まれている場合 — ほとんどのブログ、ドキュメント、help center。

Auto(デフォルト)

必要に応じて当社が判定し、サイトがJavaScriptを必要とする場合はFullに切り替えます。

確信がない場合。ほとんどの人に適しています。

Full

各ページをブラウザで読み込み、JavaScriptを実行します。遅くなります。

コンテンツがスクリプト実行後にのみ表示される場合、シングルページアプリやJavaScript多用ページ。

標準URLを無視する

有効にすると、ウェブスクレイパーはcanonicalリンクタグ(rel="canonical")を無視し、各URLを個別のページとして扱います。このオプションはデフォルトで無効です。

サイトが多くのページを1つのcanonical URLに向けており、その結果コンテンツが見落とされている場合に役立ちます。

クエリパラメータの除外とrobots.txtの尊重

詳細設定の下にさらに2つのトグルがあります。両方ともデフォルトでオフです。

Respect robots.txt:クローラーがサイトのrobots.txtのdisallowルールに従うようにします。他のクローラーがアクセスできるものと同期を一貫させたい場合はオンにしてください。robots.txtがFinで取り込みたいコンテンツを含むパスを禁止している場合、同期される内容が減少します。

Exclude query parameters:クエリ文字列(?)を含むURLをスキップします。トラッキング、セッション、ソートパラメータが付加され近似重複ページが大量に生成される場合はオンにしてください。/docs?page=intro のように実際のコンテンツがクエリ文字列の背後にある場合はオフのままにしてください — そうしたページもスキップされます。

対象ユーザー

Targetステップでは、同期されたすべてのページに対するデフォルトのオーディエンスを設定したり、URLベースのルールを作成してURLパターンに基づいて特定のオーディエンスを自動的に割り当てたりできます — 手動タグ付けは不要です。

まず、このソースのコンテンツがFin AI Agentおよび/またはCopilotで有効にするかどうかを決めてください。

その後、既定のFinオーディエンスを設定してこのソースから同期されたすべてのページに適用するか(既定が設定されていない場合、コンテンツは既定でEveryoneになります)、またはURLパターンに基づいて特定のオーディエンスを割り当てるルールを作成できます。

例:URLに/ukが含まれる場合、UKオーディエンスを割り当てる。 ルールは同期中に評価されるため、FinとCopilotは常に適切なコンテンツを適切なオーディエンスに提供します。

各ルールは3つのURL比較子をサポートします:

  • Starts with — 指定したプレフィックスで始まるURLに一致します。

  • Ends with — 指定したサフィックスで終わるURLに一致します。

  • Contains — 指定した部分文字列を含むURLに一致します。

注:

  • ライブプレビューは各ルールに一致するページ数を表示し、保存前にルールを検証するのに役立ちます。これはウェブ同期ソースにサイトマップが利用可能であることが必要です。サイトマップがない場合でもルールは適用されますが、一致をプレビューできません。

  • ルールは作成時に自動命名されますが、名前を変更できます。ウェブ同期ソースごとに最大10個のルールが適用されます。

  • オーディエンスルールは追加のみです:コンテンツにオーディエンスを追加しますが、既存の割り当てを削除することはありません。ルールを削除しても過去のオーディエンス割り当ては元に戻りません。

同期設定を確認する

最後に、同期設定を確認してからSync website をクリックして、ウェブサイトコンテンツの同期をIntercomと開始します。


ウェブサイトソースを管理する

同期が完了すると、メール通知を受け取り、ウェブサイトはTrain > Contentの「Content sources」セクションに同期済みソースとして表示されます。

ウェブサイトソースをクリックすると、公開URLから同期された個々のページをプレビューおよび管理できます。

注:ウェブサイトソースは読み取り専用で、Finワークスペース内で編集できません。ソース側で編集する必要があります。

設定を構成する

ウェブサイトページを表示すると、右側に「詳細」パネルがあり、次の内容が含まれます:

  • データ:コンテンツタイプ、言語、作成日、最終更新日(ソースと最後に同期した日時)を表示します。

  • Fin: Fin AgentおよびFin Copilot用に有効/無効にします。有効にすると、コンテンツはそれぞれ顧客とチームメンバーが利用できるようになります。

    • スケジューリング:設定された日付にFinとCopilot向けにコンテンツをオンまたはオフにします。

    • 対象: 顧客が Fin Agent から自分に関連する回答とコンテンツのみを受け取るようにしてください。

  • リンク: このウェブサイトソースの公開URL。

  • レポート: このコンテンツがどれくらい会話の解決に使われているかを追跡します(Fin Agent が使用)。

  • タグ: ウェブページをグループ化してコンテンツを整理するためにタグを追加します。

Fin または Copilot に利用可能にする

ウェブサイトソースを Fin Agent または Fin Copilot に利用可能にするには、Train > Content に移動し、"Content sources" セクションのウェブサイトソースをクリックして、同期した該当ページを開きます。

"Details" パネルから下にスクロールして “Fin” を見つけ、切り替えをオンにします:

  • Fin Agent - この設定により、顧客に応答する際に Fin AI がそのウェブページを使用できるようになります(audience rules を尊重します)。

  • Fin Copilot - この設定により、チームメイトへの応答時に Fin Copilot がそのウェブページを使用できるようになります。

ウェブサイトの利用可能性をスケジュールする

同期されたウェブページが Fin と Copilot 向けにオンまたはオフになる日時とタイムゾーンを将来の日時でスケジュールできます。開始日のみを設定するか、開始と終了の両方を設定して期間限定の利用可能ウィンドウを作成できます。スケジュールは個別ページまたは一括に適用されます。

単一ページをスケジュールする

  1. ページを開きます。右側の Details パネルで、Fin ドロップダウン内の Scheduling セクションを見つけます。

  2. Schedule availability をクリックします。

  3. モーダルで: AI 製品(Fin for Service または Fin Copilot)を選択し、利用可能性(有効または無効)を設定し、日付、時刻、タイムゾーンを選びます。

  4. オプションで Set end date を切り替えて終了日時を追加できます — その時点で操作は自動的に逆になります。

  5. 確認するには Schedule をクリックします。

ページを一括でスケジュールする

  1. コンテンツ一覧から複数のページを選択します。

  2. More actions ドロップダウンに移動し、Schedule availability を選択します。

  3. 同じスケジューリングモーダルが選択したすべての項目に適用されます。

スケジュールの仕組み

  • 開始日のみ: 指定時刻に有効/無効の動作が実行され、その後は手動で変更するまで維持されます。

  • 開始+終了日: コンテンツは開始時にオン(またはオフ)になり、終了時に自動的に元に戻ります。

  • 手動の変更は保留中のスケジュールをキャンセルしません: スケジュール設定後に手動で利用可能性を切り替えた場合でも、予定された時刻にスケジュールされた移行は実行され、手動の変更を上書きします。

  • エージェントごとにアイテムあたり1つの保留スケジュール: 新しいスケジュールを設定すると前のスケジュールが置き換えられます — 重複は発生しません。

  • 削除されたコンテンツ: ページがスケジュール発動前に削除された場合、スケジュールは適用されず、エラーは表示されません。

特定のオーディエンスに利用可能にする

同期されたコンテンツに対して、ウェブ同期作成時にURLベースのルールを使って自動的にオーディエンスを割り当てるか、ページごとに手動で割り当てることができます。まず、ターゲットにしたいオーディエンスを作成して定義する必要があります。

その後、Train > Content に移動し、"Content sources" セクションのウェブサイトソースをクリックして、同期した該当ページを開きます。

"Details" パネルから下にスクロールして “Fin” を見つけ、オーディエンスのドロップダウンで事前定義したオーディエンスのいずれかを選択します。

注:

  • 公開URLのデフォルトオーディエンスは “Everyone” です。

  • Fin Agent は公開URLに適用したオーディエンスも尊重し、顧客がオーディエンスルールに一致する場合にのみこの記事を使用して質問に回答します。

既存の同期にオーディエンスルールを追加または編集する

オーディエンスターゲティングを追加するために同期を再作成する必要はありません。Train > Content に移動し、ソースを選択し、右上の設定ドロップダウンをクリックして Open settings を選択します。Target ステップに移動して URL ベースのルールを追加または編集します。

注: 既存のウェブ同期にオーディエンスルールを追加すると、それらはそのソースから既に取り込まれたすべてのコンテンツに遡及的に適用されます — 今後の新しいコンテンツだけではありません。

ウェブサイトをソースとして再同期または削除する

公開URLをソースとして再同期または削除する場合は、Train > Content に移動し、"Content sources" セクションのウェブサイトソースをクリックして、右上の Settings ドロップダウンを開きます。

ここで、Re-sync または Remove this source. を選択できます。

ヒント: ソースサイトで行った更新はすぐには Intercom に表示されません。ウェブサイトの再同期は毎週自動で行われますが、いつでも手動で再同期を実行して最新コンテンツを早く表示できます。

ウェブサイトの同期履歴を表示する

過去のウェブサイト同期の一覧を表示して、最後に実行された日時、検出されたページ、失敗したページを確認できます。Train > Content に移動し、"Content sources" セクションのウェブサイトソースをクリックして、View sync history を選択します。


表の各行は過去または実行中の実行を表し、status(started、success、failed)で実行をフィルタできます。

以下の情報が含まれます:

  • 同期日

  • ステータス

  • 同期されたページ

  • 除外されたページ

  • 失敗したページ

  • 期間

  • 同期を開始したユーザー:

同期が失敗した場合は、ステータスにカーソルを合わせると失敗の詳細な説明を確認できます。

自動同期はFinがウェブサイトを使用していないときに一時停止します

新しいソースは最初の90日間はスケジュール通りに同期されます。その後は、次のいずれかが当てはまる場合に自動的に同期され続けます:

  • 過去90日間にそのページがFinの回答で使用されている。

それ以外の場合、スケジュールされた同期は一時停止します。

一時停止中:ページはKnowledge Hubに保持され、FinおよびCopilotから利用可能です(何も削除されません)。再クロールのみが停止するため、サイトでの編集は反映されません。

復元するには: Sync nowボタンはコンテンツを一度更新しますが、スケジュールは再開しません。Finが再びそのソースを使用すると自動的に自動同期が再開します。

クロール負荷の高いウェブサイトは同期頻度が低くなります

非常に大きなサイトや完全なJavaScriptレンダリングが必要なサイトは、クロールにより多くのコストがかかります。リソースを多く消費するソースは、週次から14日に一回のスケジュールに移動します。

これはソースごとに自動で行われます。大きなサイトをより速いスケジュールのままにするには、URL除外でクロールを絞るか、ドメイン全体の代わりに特定のサブページを追加してください。


ウェブサイト同期のトラブルシューティング

よくある問題

ウェブサイトのコンテンツをインポートしてFinを有効にするには、公開URLを入力する必要があります。これにより、そのURLにネストされたすべてのページが検索され、Fin AI Agentが使用できるように同期されます。

インポーターが期待したページ数を返さなかった場合、いくつかの理由が考えられます…

入力されたURLがトップレベルのドメインではない

ウェブサイト同期は、指定したURLにアクセスしてそのURLにネストされたすべてのページを検索することで機能します。これらのページは、指定したURLと同じURLパターンでなければなりません。

たとえば、トップレベルドメインが https://myhelpcenter.com/home の場合、インポートしたいすべてのページはURLに /home プレフィックスを含む必要があります(例:https://myhelpcenter.com/home/article)。含まれていない場合は、プレフィックスを削除して基本のURL(例:https://myhelpcenter.com)を使用して、再度インポートしてください。

URLが非公開である

使用したいコンテンツがログインの背後にある場合、Finはそれにアクセスしてインポートすることはできません。

ページの上限

ウェブサイト同期には2つの制限があります:

  • Domains: 最大で100の異なるトップレベルドメインを同期できます。

  • Pages per source: Finは各ソースから最大4,000ページを同期します。

単一ページに非常に大量のコンテンツが含まれていると、同期が失敗することがあります。同期が失敗した場合は、メールで通知されます。

注意:

  • ソースが4,000ページを超える場合は、各ソースが制限内に収まるようにいくつかのソースに分割してください:

    • サイトを小さなセクションに分割し、各セクションを個別のソースとして追加します。

    • たとえば、製品エリアやカテゴリごとにURLパスを分けて同期します。

  • これにより各ソースがページ上限を下回り、同期ごとの処理コンテンツも減らせます。

特定の地域IPに制限されたウェブサイト

Finのウェブサイト同期(Fin AI AgentおよびCopilot用の公開URLを追加するために使用)が現時点では専用のカスタムユーザーエージェント文字列を使用していないことに注意してください。

サイトが厳しいアンチクロール保護をしている場合、固定のIPアドレスのセットを許可リストに追加してコンテンツを取り込めるようにするために、static proxyを使用できます。ウェブサイト同期を作成または編集する際に、Advanced settingsでstatic proxyを選択してください。

  • IPアドレスで: サイトが許可リストを必要とする場合、Advanced settingsでstatic proxyを選択してください — 許可リストに追加する固定のIPのセットが提供されます。

  • これらのリクエストはウェブサイト同期のためだけに使用されます。Messengerのトラフィックやエンドユーザーのトラッキングには影響しません。

非英語または国際的なサイトのページが同期されない

サイトマップに非ASCII文字(アクセント付き文字や中国語・アラビア語などのスクリプト)を含むURLがある場合、それらのページの一部が期待通りに同期されないことがあります。サイトマップの検出はこれらのURLをサポートしますが、同期プロセスの他の部分で問題が発生することがあります。手動で再同期してみてください。ページがまだ欠落している場合はサポートに連絡してください。

ウェブサイト同期エラー

ウェブサイトコンテンツを同期するとき、プロセス中に何が起こったかを示すさまざまなステータスが表示されることがあります。ウェブサイト同期のステータスを確認するには、Train > Contentに移動し、ウェブサイトソースを選択して、Status ドロップダウンで次をフィルタリングしてください:

  • 同期中

  • ライブ

  • 失敗

  • 除外済み

それぞれの意味と次にできることは以下の通りです:

同期中

ページの同期はまだ進行中です。初回同期は、コンテンツ量によって数分から1時間以上かかることがあります。

ライブ

ページは正常に同期され、FinおよびCopilotで有効化できます。

注意: 成功した同期でもページ上のすべてのコンテンツをスクレイプできているとは限りません。完全なカバレッジを確認したい場合は、そのページからFinが見つけるはずの回答でFinをプレビューすることをおすすめします。

除外

これらのページは、Advanced sync settingsで除外したため、意図的に同期されていません。指定がない限り、再試行や含めることはできません。

失敗

これらのエラーは同期が完了しなかったことを示し、再試行する前にお客様側での対応が必要な場合があります:

1. 不明なエラー

  • メッセージ:「このページにアクセスできませんでした。読み込みが遅いかブロックされています。もう一度同期するか、失敗する場合はサポートにお問い合わせください。」

  • 意味:ページにアクセスするのを妨げるものがありましたが、原因は明確ではありません。

2. セッションがブロックされている/レート制限

  • メッセージ:「ウェブサイトが当社のコンテンツへのアクセスを防いでいます。アンチクローラー設定やファイアウォールでブロックされていないか確認してください。サイトの設定を確認して再度同期してください。問題が続く場合はサポートにお問い合わせください。」

  • 意味:お客様のサイトが当社のクローラーを積極的にブロックまたは制限しています。

3. ネットワーク、タイムアウト、または類似のエラー

  • メッセージ:「このページにアクセスできませんでした。読み込みが遅いか、アンチクローラー設定やファイアウォールでブロックされている可能性があります。サイトの設定を確認して再度同期してください。問題が続く場合はサポートにお問い合わせください。」

  • 意味:ページが時間内に読み込まれなかったか、ネットワークの問題やブロックにより到達できませんでした。

    対応方法:「Navigation timeout」エラーは、多くの場合、サイト上のボット保護やセキュリティソフトがIntercomのクローラーをブロックしていることが原因です。解決するには、上のAdvanced settingsセクションに記載されているstatic proxy IP addressesをホワイトリストに登録し、ウェブサイト同期を作成または編集する際にAdvanced settingsで一致するプロキシ地域を選択してから、同期を再試行してください。

4. 重複

  • メッセージ:「このページは既に同期されている別のページと同じ内容です。1つのバージョンのみが含まれます。」

  • 意味:同一のコンテンツを他の場所で検出したため、1つのコピーのみが保持されます。

5. キーワードによるフィルタリング

  • メッセージ:「URLにcategorycollection、またはtagのようなキーワードが含まれるページはデフォルトで除外されます。これらは通常ユニークなコンテンツを含まないためです。このページを含める必要がある場合は、サポートにお問い合わせください。」

  • 意味:これらのURLはリストを表すことが多く、独立したコンテンツページではありません。

6. ステータスコード400

  • メッセージ:「ページのコンテンツが見つかりません。URLが有効でページが問題なく読み込まれるか確認してください。」

  • 意味:URLが壊れているか、ウェブサイトでエラーが返されている可能性があります。

7. ブロックされたURL

  • メッセージ:「このウェブサイトのdomainは同期対象からブロックされています。必要な場合はサポートにお問い合わせください。」

  • 意味:domainは意図的に同期から除外されています。


​失敗したページ同期は、ページにカーソルを合わせ、三点メニューを選択してからResync.を選択すると再試行できます。

こちらの回答で解決しましたか?