メインコンテンツにスキップ

ウェブサイトを同期および管理する

ウェブサイトの公開URLからFinをトレーニングする方法。

Finをウェブサイトのコンテンツでトレーニングしたい場合は、そのサイトの公開URLを同期することで可能です。


始める

Train > Content に移動し、「Add content」セクションの下にあるWebsite syncを選択します。

ウェブサイトの公開URL(トップレベルドメイン)を入力し、Next.をクリックします。

これにより、指定したウェブサイトURLのすべてのページが取得され、すべてのサブドメインページから読み取られます。

ヒント:

同期するページを確認する

URLを入力すると、そのURLが有効でアクセス可能かどうかを確認します。その後、同期するページを確認する必要があります。選択した各セクションにリンクされているすべてのサブページが同期されます。関連性があり最新のコンテンツのみを選択してください。

ヒント:

  • ヘルプ記事、ガイド、FAQなどのサポートコンテンツを含むページやセクションを選択してください。

  • マーケティングページ、商品リスト、複雑なレイアウトのページは選択しないでください。

  • 選択したセクション内のすべてのリンクされたサブページは自動的に含まれます。

  • 詳細設定でいつでも選択を更新できます。

詳細設定 [オプション]

追加のURLの設定、除外するURL、除外するCSSセレクターなどを設定するには、詳細設定のドロップダウンを選択してください。

追加のURL

ウェブサイトの構造はさまざまです。最も関連性の高いコンテンツを同期するために、特定のサブページの追加URLを追加することをお勧めします。

例えば、上記でhttps://myhelpcenter.com/helpを主要URLとして入力した場合、https://myhelpcenter.com/help/index.htmlのような特定のURLも追加したいかもしれません。

除外するURL

同期したくない特定のページを除外するには、URLグロブのリストを追加できます。

URLグロブとは?

グロブとは、ファイルパスやURLを一致させるために使用されるリテラル文字やワイルドカード文字の文字列です。グロビングは、1つ以上のグロブを使ってファイルシステム上のファイルを見つける行為です。URLグロブを使うことで、ほぼ同じで一部だけが異なる複数のURLをまとめて指定できます。

例えば、このURLグロブ https://{store,docs}.example.com/** は、https://store.example.com/ または https://docs.example.com/ で始まるすべてのURLにクロールアクセスを許可します。https://example.com/**/*\?*foo=*

ヒント: 除外したいURLにグロブパターンが合っているか不明な場合は、DigitalOcean's Glob Toolを使って、サンプルURLに対してパターンをテストできます。(これはIntercomが管理していないサードパーティツールです。)

除外するCSSセレクター

特定のページ要素を除外するには、除外したいセクションや要素のCSSセレクターを使用できます。

これは無関係なページコンテンツをスキップするのに役立ちます。値はdocument.querySelectorAll()関数で受け入れられる有効なCSSセレクターでなければなりません。デフォルトで、一般的なナビゲーション要素、ヘッダー、フッター、モーダル、スクリプトはすでに除去しています。

注意: ウェブサイト同期時に画像はデフォルトで取り込まれます。Finが返信で画像やGIFを使用する方法を制御するには、Using images and GIFs in Fin AI Agent repliesを参照してください。

クリック可能なCSSセレクター

この設定により、CSSセレクターで識別されたDOM要素をウェブ同期プロセス中にクリックできます。

これは折りたたまれたセクションを展開してテキストコンテンツを取得するのに役立ちます。値はdocument.querySelectorAll()関数で受け入れられる有効なCSSセレクターでなければなりません。

例は "[aria-expanded=\"false\"]", #expand_section です。

複雑な条件もCSSセレクターで表現できます。CSSでは、セレクターをスペースなしで連結するとAND条件になり、例えば .button.blue.small は3つすべてのクラスを持つ要素にマッチします。

カンマ(,)区切りはOR条件として機能し、例えば .button, .blue, h1 はクラスbutton、またはクラスblue、またはh1要素すべてを対象にします。

CSSセレクターの読み込み待機

ページ上で遅れて表示される可能性のあるコンテンツを対象にするため、ウェブスクレイパーがスクレイピング前に待機するCSSセレクターを追加できます。

これは、デフォルトのコンテンツ読み込み認識が失敗するページに有効です。このオプションを設定するとデフォルト動作は無効になり、このセレクターで指定された要素が表示された場合のみページが処理されます。

注意: 値はdocument.querySelectorAll()関数で受け入れられる有効なCSSセレクターでなければなりません。

XMLサイトマップ

サイトマップ対応ウェブサイトでXMLサイトマップを有効にすると、初期URLから到達できないページにもアクセスでき、より堅牢なウェブ同期が可能になります。

このオプションを有効にすると、ウェブスクレイパーは提供されたソースURLのドメインでサイトマップを探し、クロールしたページのリンクと同様に一致するURLをキューに入れます。sitemap.xmlファイルを別の開始URLとして直接追加することもできます(例:https://www.example.com/sitemap.xml)。

プロキシ地域

特定の地域や国に設定されたプロキシを使ってウェブサイトをクロールする必要がある場合、クロール用のプロキシを選択できます。

現在サポートしているプロキシは以下の通りです:

  • ローテーション: アメリカ合衆国、ドイツ、フランス、イギリス、チェコ、ハンガリー

  • 静的:

    • アメリカ合衆国 - 119.13.211.225, 161.123.167.215, 94.176.49.232, 185.223.56.90, 154.17.143.135

    • ヨーロッパ - 178.171.116.231, 206.232.77.243, 206.232.90.11, 209.20.175.180, 45.94.247.149

    • オーストラリア - 154.220.151.84, 173.254.193.121, 160.224.101.213, 160.224.100.176, 212.70.22.41

クローラータイプ

このウェブサイトを同期する際に、クローラーが各ページをどの程度詳細にレンダリングするかを選択してください。

  • ページの同期が空または切り詰められている場合は、通常JavaScriptのレンダリングが原因です。Fullに切り替えて再同期してください。

  • Fullは負荷が大きいため、大きなソースはスケジュールが短縮される可能性があります。

  • 既存のソースでこれを変更し、再同期して比較することができます。

オプション

機能

使用する場合

高速

JavaScriptを実行せずにHTMLを読み取ります。

コンテンツは初期HTMLに含まれています — ほとんどのブログ、ドキュメント、help center。

自動(デフォルト)

サイトにJavaScriptが必要な場合は、当社が選択しFullに切り替えます。

確信がない場合に適しています。ほぼすべての人に適しています。

Full

各ページをブラウザで読み込み、JavaScriptを実行します。遅くなります。

コンテンツはスクリプト実行後にのみ表示されます。シングルページアプリやJavaScriptが多用されるページ。

正規URLを無視する

有効にすると、ウェブスクレイパーは正規リンクタグ(rel="canonical")を無視し、各URLを別々のページとして扱います。このオプションはデフォルトで無効です。

これは、多くのページが1つの正規URLを指していて、その結果コンテンツが見逃されている場合に役立ちます。

クエリパラメータの除外とrobots.txtの尊重

詳細設定の下にさらに2つのトグルがあります。両方ともデフォルトでオフです。

Respect robots.txt:クローラーがサイトのrobots.txtのdisallowルールに従うようにします。他のクローラーに許可する内容と同期を一致させるためにオンにしてください。robots.txtがFinに含めたいコンテンツのパスを禁止している場合、同期される内容が減少します。

Exclude query parameters:クエリ文字列(?)を含むURLをスキップします。トラッキング、セッション、ソートパラメータが多くのほぼ重複ページを生成する場合にオンにしてください。クエリ文字列の背後に実際のコンテンツがある場合(例:/docs?page=intro)はオフのままにしてください。これらのページもスキップされてしまいます。

ターゲットオーディエンス

Targetステップでは、同期されたすべてのページのデフォルトオーディエンスを設定し、URLパターンに基づいて特定のオーディエンスを自動的に割り当てるルールを作成できます。手動タグ付けは不要です。

まず、このソースのコンテンツがFin AI Agentおよび/またはCopilotで有効かどうかを決定します。

次に、このソースから同期されたすべてのページに適用するデフォルトのFinオーディエンスを設定するか(デフォルトが設定されていない場合、コンテンツはEveryoneに設定されます)、URLパターンに基づいて特定のオーディエンスを割り当てるルールを作成します。

例:URLに/ukが含まれる場合、UKオーディエンスを割り当てる。ルールは同期時に評価されるため、FinとCopilotは常に適切なコンテンツを適切なオーディエンスに提供します。

各ルールは3つのURL比較子をサポートします:

  • Starts with — 指定した接頭辞で始まるURLに一致します。

  • Ends with — 指定した接尾辞で終わるURLに一致します。

  • Contains — 指定した部分文字列を含むURLに一致します。

注意:

  • ライブプレビューは各ルールに一致するページ数を表示し、保存前にルールの検証を助けます。これはウェブ同期ソースにサイトマップが必要です。サイトマップがない場合でもルールは適用されますが、一致のプレビューはできません。

  • ルールは作成時に自動命名されますが、名前の変更も可能です。ウェブ同期ソースごとに最大10ルールが適用されます。

  • オーディエンスルールは加算的です:コンテンツにオーディエンスを追加しますが、既存の割り当てを削除することはありません。ルールを削除しても過去の割り当ては元に戻りません。

同期設定を確認する

最後に同期設定を確認し、Sync website をクリックしてIntercomとウェブサイトコンテンツの同期を開始してください。


ウェブサイトソースを管理する

同期が完了すると、メール通知が届き、ウェブサイトはTrain > Contentの「Content sources」セクションに同期済みソースとして表示されます。

ウェブサイトソースをクリックすると、公開URLから同期された個々のページをプレビューおよび管理できます。

注意:ウェブサイトソースは読み取り専用で、Finワークスペース内で編集できません。ソース側で編集する必要があります。

設定を構成する

ウェブサイトページを表示すると、右側に「詳細」パネルがあり、以下が含まれます:

  • データ:コンテンツタイプ、言語、作成日、最終更新日(ソースと最後に同期した日時)を表示します。

  • Fin: Fin AgentおよびFin Copilotの有効/無効を切り替えます。有効にすると、それぞれ顧客とチームメンバーがコンテンツを利用できるようになります。

    • スケジューリング:Fin と Copilot のコンテンツを設定した日にオンまたはオフにします。

    • オーディエンス:顧客が自分に関連する Fin Agent の回答とコンテンツのみを受け取るようにします。

  • リンク:このウェブサイトソースの公開URL。

  • レポート:このコンテンツが Fin Agent による会話解決にどれだけ使われたかを追跡します。

  • タグ:ウェブページをグループ化し、コンテンツを整理するためにタグを追加します。

Fin または Copilot に利用可能にする

ウェブサイトソースをFin AgentまたはFin Copilotで利用可能にするには、Train > Contentに移動し、「Content sources」セクションのウェブサイトソースをクリックして、同期した該当のウェブページを開きます。

「詳細」パネルから下にスクロールして「Fin」を見つけ、トグルをオンにします。

  • Fin Agent - この設定により、Fin AI が顧客対応時にこのウェブページを利用できるようになります(オーディエンスルールを尊重します)。

  • Fin Copilot - この設定により、Fin Copilot がチームメイト対応時にこのウェブページを利用できるようになります。

ウェブサイトの利用可能時間をスケジュールする

同期されたウェブページが Fin と Copilot でオンまたはオフになる日時とタイムゾーンを将来の日付でスケジュールできます。開始日のみ設定するか、開始日と終了日の両方を設定して期間限定の利用可能時間を作成します。スケジューリングは個別ページまたは一括で適用されます。

単一ページのスケジュール設定

  1. ページを開きます。右側の詳細パネルで、Fin ドロップダウン内のスケジューリングセクションを見つけます。

  2. スケジュールの設定をクリックします。

  3. モーダルで:AI製品(Fin for Service または Fin Copilot)を選択し、利用可能状態(有効または無効)を設定し、日付、時間、タイムゾーンを選びます。

  4. 必要に応じて終了日の設定をトグルして終了日時を追加します。終了日時に自動的に元に戻ります。

  5. 確認のためにスケジュールをクリックします。

複数ページの一括スケジュール設定

  1. コンテンツリストから複数のページを選択します。

  2. その他の操作ドロップダウンからスケジュールの設定を選択します。

  3. 選択したすべての項目に同じスケジューリングモーダルが適用されます。

スケジューリングの仕組み

  • 開始日のみ:スケジュールされた時間に有効/無効の操作が実行され、その後は手動で変更するまでその状態が維持されます。

  • 開始日+終了日:開始時間にコンテンツがオン(またはオフ)になり、終了時間に自動的に元に戻ります。

  • 手動変更は保留中のスケジュールをキャンセルしません:スケジュール設定後に手動で利用可能状態を切り替えても、スケジュールされた変更は予定通りに実行され、手動変更を上書きします。

  • エージェントごとにアイテムごとに保留中のスケジュールは1つのみ:新しいスケジュールを設定すると前のスケジュールが置き換えられ、重複はありません。

  • 削除されたコンテンツ:ページがスケジュール実行前に削除された場合、スケジュールは適用されずエラーは表示されません。

特定のオーディエンスに利用可能にする

同期されたコンテンツに対して、ウェブ同期作成時にURLベースのルールを使って自動的に、またはページごとに手動でオーディエンスを割り当てることができます。まず、ターゲットにしたいオーディエンスを作成・定義してください。

次にTrain > Contentに移動し、「Content sources」セクションのウェブサイトソースをクリックして、同期した該当のウェブページを開きます。

「詳細」パネルから下にスクロールして「Fin」を見つけ、オーディエンスのドロップダウンから事前定義したオーディエンスを選択します。

注意:

  • 公開URLのデフォルトオーディエンスは「Everyone」です。

  • Fin Agent は公開URLに適用されたオーディエンスルールも尊重し、ルールに合致する場合のみこの記事を使って顧客の質問に回答します。

既存の同期にオーディエンスルールを追加または編集する

オーディエンスターゲティングを追加するために同期を再作成する必要はありません。Train > Contentに移動し、ソースを選択、右上の設定ドロップダウンをクリックして設定を開くを選択します。ターゲットステップでURLベースのルールを追加または編集します。

注意:既存のウェブ同期にオーディエンスルールを追加すると、そのソースから既に取り込まれたすべてのコンテンツに遡及的に適用されます。新しいコンテンツだけでなく。

ウェブサイトをソースとして再同期または削除する

公開URLをソースとして再同期または削除したい場合は、Train > Contentに移動し、「Content sources」セクションのウェブサイトソースをクリックして、右上の設定ドロップダウンを開きます。

ここで、再同期またはこのソースを削除を選択できます。

ヒント:ソースウェブサイトでの更新はすぐにIntercomに反映されません。ウェブサイトの再同期は毎週自動で行われますが、手動で再同期を実行して最新コンテンツを早く表示することも可能です。

ウェブサイト同期履歴を見る

過去のウェブサイト同期の一覧を見て、最後に実行された日時、見つかったページ、失敗したページを確認できます。Train > Contentに移動し、「Content sources」セクションのウェブサイトソースをクリックして、同期履歴を見るを選択します。


テーブルの各行は過去または現在の実行を表し、ステータス(開始、成功、失敗)でフィルターできます。

以下の情報が含まれます:

  • 同期日時

  • ステータス

  • 同期されたページ数

  • 除外されたページ数

  • 失敗したページ

  • 期間

  • 同期開始者

同期に失敗した場合は、ステータスにカーソルを合わせると詳細な説明が表示されます。

Finがウェブサイトを使用していないときは自動同期が一時停止します

新しいソースは最初の90日間はスケジュール通りに同期されます。その後、次のいずれかが真の場合に自動的に同期を続けます:

  • 過去90日間にそのページがFinの回答で使用された場合。

それ以外の場合、スケジュールされた同期は一時停止します。

一時停止中:ページはKnowledge Hubに残り、FinとCopilotで利用可能なままです(削除されません)。再クロールのみ停止し、サイトの編集は反映されません。

復元するには:今すぐ同期ボタンは一度だけコンテンツを更新しますが、スケジュールは再開しません。Finが再びソースを使用すると自動同期が再開されます。

クロール負荷の高いウェブサイトは同期頻度が低くなります

非常に大きなサイトや完全なJavaScriptレンダリングが必要なサイトはクロールコストが高くなります。リソース負荷が高いソースは週次から14日ごとのスケジュールに変更されます。

これはソースごとに自動で行われます。大きなサイトをより速いスケジュールで維持するには、URL除外を使ってクロール範囲を狭めるか、ドメイン全体ではなく特定のサブページを追加してください。


ウェブサイト同期のトラブルシューティング

よくある問題

Finを有効にするためにウェブサイトコンテンツをインポートする際は、public URLを入力する必要があります。これにより、そのURL以下のすべてのページが検索され、Fin AI Agentで使用するために同期されます。

インポーターが期待したページ数を返さなかった場合、いくつかの理由があります...

指定されたURLがトップレベルドメインではない

ウェブサイト同期は、指定したURLにアクセスし、そのURL以下のすべてのページを検索して同期します。これらのページは指定したURLと同じURLパターンである必要があります。

例えば、トップレベルドメインがhttps://myhelpcenter.com/homeの場合、インポートしたいすべてのページはURLに/homeプレフィックスを含む必要があります。例:https://myhelpcenter.com/home/article。含まれていない場合はプレフィックスを外し、最も基本的なURLの幹を使用してください。例:https://myhelpcenter.com。その後、再度インポートを試みてください。

URLがプライベートである

使用したいコンテンツがログインの背後にある場合、Finはアクセスやインポートができません。

ページ制限

ウェブサイト同期には2つの制限があります:

  • Domains: 最大100の異なるトップレベルドメインを同期できます。

  • Pages per source: Finは各ソースから最大4,000ページを同期します。

1ページに非常に大量のコンテンツが含まれている場合も同期に失敗することがあります。同期失敗時はメールで通知されます。

注意:

  • ソースに4,000ページ以上ある場合は、複数のソースに分割して各ソースが制限内に収まるようにしてください:

    • サイトを小さなセクションに分割し、それぞれを独立したソースとして追加します。

    • 異なるURLパスを別々に同期します。例えば、製品エリアやカテゴリごとに1つのソースを作成します。

  • これにより各ソースがページ制限内に収まり、同期ごとの処理コンテンツ量が減ります。

特定地域のIPに制限されたウェブサイト

Finのウェブサイト同期(Fin AI AgentCopilotのためのpublic URL追加に使用)は現時点で専用のカスタムユーザーエージェント文字列を使用していません。

サイトに厳しいクロール防止がある場合は、static proxyを使用して固定IPアドレスの許可リストを作成し、コンテンツの取り込みを確実にできます。ウェブサイト同期の作成または編集時にAdvanced settingsでstatic proxyを選択してください。

  • IPアドレスによる:サイトが許可リストを必要とする場合、Advanced settingsでstatic proxyを選択すると、許可リストに追加する固定IPセットが得られます。

  • これらのリクエストはウェブサイト同期のみに使用され、Messengerのトラフィックやエンドユーザートラッキングには影響しません。

非英語または国際サイトのページが同期されない

サイトマップに非ASCII文字(アクセント付き文字や中国語、アラビア語などのスクリプト)が含まれるURLがある場合、一部のページが期待通りに同期されないことがあります。サイトマップの検出はこれらのURLをサポートしていますが、同期プロセスの他の部分で問題が発生することがあります。手動で再同期を試みてください。ページがまだ不足している場合はサポートに連絡してください。

ウェブサイト同期エラー

ウェブサイトコンテンツを同期すると、処理中に何が起こったかを示すさまざまなステータスが表示されることがあります。ウェブサイト同期のステータスを見るにはTrain > Contentに移動し、ウェブサイトソースを選択して、Status ドロップダウンでフィルターしてください:

  • 同期中

  • ライブ

  • 失敗

  • 除外済み

各ステータスの意味と次にできることは以下の通りです:

同期中

ページ同期はまだ進行中です。初回同期はコンテンツ量により数分から1時間以上かかることがあります。

ライブ

ページは正常に同期され、FinとCopilotで有効にできます。

注意: 同期が成功しても、ページ上のすべてのコンテンツをスクレイピングできたとは限りません。完全なカバレッジを確認したい場合は、Finのプレビューでそのページから期待される回答を確認することをお勧めします。

除外済み

これらのページは、高度な同期設定で除外したため、意図的に同期されていません。特に指定がない限り、再試行や含めることはできません。

失敗

これらのエラーは同期が完了しなかったことを意味し、再試行前にお客様側での変更が必要な場合があります。

1. 不明なエラー

  • メッセージ:「このページにアクセスできませんでした。遅いかブロックされている可能性があります。再度同期を試すか、失敗する場合はサポートに連絡してください。」

  • 意味: ページへのアクセスが妨げられましたが、原因は不明です。

2. セッションブロック / レート制限

  • メッセージ:「ウェブサイトがコンテンツへのアクセスを防いでいます。アンチクローラー設定やファイアウォールでブロックされていないか確認してください。サイト設定を確認し、再度同期を試してください。問題が続く場合はサポートに連絡してください。」

  • 意味: お客様のサイトが当社のクローラーを積極的にブロックまたは制限しています。

3. ネットワーク、タイムアウト、または類似のエラー

  • メッセージ:「このページにアクセスできませんでした。読み込みが遅いか、アンチクローラー設定やファイアウォールでブロックされている可能性があります。サイト設定を確認し、再度同期を試してください。問題が続く場合はサポートに連絡してください。」

  • 意味: ページが時間内に読み込まれなかったか、ネットワークの問題やブロックにより到達できませんでした。

    対処法: 「ナビゲーションタイムアウト」エラーは、サイトのボット保護やセキュリティソフトがIntercomのクローラーをブロックしていることが多いです。解決するには、上記の高度な設定セクションに記載されている静的プロキシIPアドレスをホワイトリストに登録し、ウェブサイト同期の作成または編集時に高度な設定で該当するプロキシ地域を選択してから同期を再試行してください。

4. 重複

  • メッセージ:「このページは既に同期されている別のページと同じコンテンツです。1つのバージョンのみが含まれます。」

  • 意味: 同一のコンテンツが他に検出されたため、1つだけ保持されます。

5. キーワードフィルタリング

  • メッセージ:「URLにcategorycollection、またはtagのようなキーワードが含まれるページは、通常ユニークなコンテンツを含まないためデフォルトで除外されます。このページを含める必要がある場合はサポートに連絡してください。」

  • 意味: これらのURLはリストを表すことが多く、単独のコンテンツページではありません。

6. ステータスコード400

  • メッセージ:「ページコンテンツが見つかりません。URLが有効でページが問題なく読み込まれるか確認してください。」

  • 意味: URLが壊れているか、ウェブサイトでエラーを返している可能性があります。

7. ブロックされたURL

  • メッセージ:「このウェブサイトのdomainは同期からブロックされています。必要な場合はサポートに連絡してください。」

  • 意味: domainは意図的に同期から除外されています。


​失敗したページ同期は、ページにカーソルを合わせて三点メニューを選択し、再同期を選ぶことで再試行できます。

こちらの回答で解決しましたか?