参照フレームワークとエージェント評価: AEO ベース。
エージェント評価フレームワークは、タスクの自律性、精度、コスト、待ち時間、ライフサイクル全体の成功を測定します。する。
Updated April 12, 2026
エージェント評価フレームワークは、正確さだけでなく、自律性、コスト、待ち時間、エージェントのライフサイクル全体にわたる実際のタスクの成功も測定します。エージェントとサイトとのやり取りが成功した場所と失敗した場所を正確に示すことで、AEO を推測からデータ主導の最適化に変えます。
AEO にとって評価が重要な理由#
エージェントがサイトと対話するときの結果は、エージェントの能力とサイトの構造の両方によって異なります。評価フレームワークは、この 2 つを区別するのに役立ちます。エージェントが常に価格の抽出に失敗する場合、問題は構造化データです。エージェントが正しくチェックアウトしているにもかかわらず、間違った製品が推奨されている場合、問題はエンティティ マッピングにあります。
評価がなければ区別はできません。外から見ると、どの失敗も同じように見えます。
エージェント評価の 5 つの側面#
精度#
エージェントはサイトから正しい情報を取得していますか?エージェントによって抽出されたデータを信頼できる情報源と比較します。製品名、価格、在庫状況、仕様、保険条件は正確に一致する必要があります。
ページごと、データ フィールドごとの精度を測定します。サイトの製品名については 98% 正確ですが、配送ポリシーについては 75% しか正確ではありません。その特異性により、どこに焦点を当てて改善すべきかがわかります。
自律性#
エージェントは人間の介入なしで何ステップを完了できますか?完全に自律的なインタラクション (検出、抽出、アクション、支払い、検証) は、ステップ 3 で人間の承認が必要なインタラクションよりもスコアが高くなります。
AEO の場合、これは実行層がエンドツーエンドのエージェント ワークフローをどの程度サポートしているかを測定します。 実行層ガイド では、インフラストラクチャ要件について説明しています。
収益性#
各エージェントの対話には、トークン、API 呼び出し、処理時間のコストがどれくらいかかりますか?インタラクションあたりのコストが高いと、エージェントのトラフィックが妨げられます。クリーンで圧縮されたデータを含むサイトはエージェントのコストを削減し、より多くの利用を呼び込みます。
コンテキスト エンジニアリング (コンテキスト エンジニアリング ガイド を参照) は、エージェントが処理する必要があるデータ量を削減することで収益性を直接向上させます。
レイテンシ#
各インタラクションはどれくらい続きますか?通常、エージェントは 10 ~ 30 秒後に期限切れになります。エンドポイントが 200 ミリ秒以内に応答する場合、エージェントのワークフローはスムーズに完了します。 8 秒以内に応答があった場合、エージェントは諦めるか、再試行することができます。
エンドポイントごと、およびインタラクション ステップごとのレイテンシーを測定します。複数ステップのワークフローを遅らせるボトルネックを特定します。
タスク完了率究極の指標。あなたのサイトに関係するエージェント ワークフローの何パーセントが正常に完了しましたか?サイトでの製品の検出から開始されてもチェックアウトに失敗したワークフローは、不完全とみなされます。#
ワークフローの種類ごとに完了を追跡します。比較ワークフロー、購入ワークフロー、クエリ ワークフローは、それぞれが異なる最適化機会をターゲットにしているため、成功率が大きく異なる場合があります。
評価慣行の構築Start with manual evaluation. 2 週間ごとに、AI アシスタントを通じて 20 の代表的なクエリを実行し、結果を文書化します。あなたのサイトについて言及するクエリは何ですか?抽出された情報は正しいですか? Can the agent complete the intended task?#
Escalate to automated assessment.エージェントの対話をシミュレートするテスト スクリプトを作成し、ページからデータを抽出し、エンドポイントへの呼び出しを試み、結果を期待した結果と比較します。毎日実行してください。
回帰テストを追加します。コンテンツ、スキーマ、またはエンドポイントを変更する場合は、評価セットを再実行して問題がないことを確認します。警察官が直面する変化は波及効果をもたらすが、人体実験では必ずしも明らかではない。
Evaluation tools in 2026#
LangChain Evals は、検索精度、応答品質、ツールの正しい使用法をテストする評価チェーンを提供します。既存の LangChain または LangGraph エージェント実装と統合します。
Ragas は回復強化生成の評価に重点を置いています。コンテキストの関連性、応答の忠実度、および応答の関連性を測定します。エージェントがコンテンツをどの程度うまく利用しているかを評価するのに役立ちます。
TruLens は、エージェントの推論パス全体を追跡するトレースベースの評価を提供します。エージェントがコンテンツに関して特定の決定を下した理由を理解するのに役立ちます。
AEO KPI ガイド は、より広範な測定フレームワークをカバーしています。
比較: アドホックなテストと構造化された評価#
|フォーカス |アドホックテスト |構造化された評価 |
| — |
| — |
| 周波数 |
| 取材範囲 |
| 回帰検出 |
| 最適化ガイド |
よくあるエラー#
精度のみを評価し、コストと遅延を無視します。完全に抽出しても 1 ページあたり 15 秒かかるエージェントは、2 秒で適切に抽出するエージェントに置き換えられます。全体像を把握するために最適化します。
よくある質問#
**サイトとエージェントのやり取りをどのくらいの頻度で評価する必要がありますか?**毎日の自動評価。 2 週間ごとに手動で評価します。重要なコンテンツまたはエンドポイントの変更後の回帰テスト。
どの評価ツールから始めるべきですか? ほとんどの AEO 実装では、基本的な自動プル テストに加えて、手動テスト (AI アシスタントを介したクエリの実行) から始めます。より詳細な分析が必要な場合は、LangChain Evals または Ragas を追加します。
優れた精度のターゲットとは何ですか? 重要なデータフィールド (価格、入手可能性、仕様) については 95% 以上。 90% は二次フィールド (説明、推奨事項) です。 85% 未満は構造上の問題を示しています。
観察できないエージェントの対話を評価するにはどうすればよいですか? サーバーのログを監視して、エージェントのトラフィック パターンを検出します。ブラウザ以外のユーザー エージェントによるエンドポイントの使用状況を追跡します。フィードバック ループ アーキテクチャを使用して、エージェントから報告された問題を取得します。エージェントのトラフィックが多いサイトのみが評価されますか? いいえ。エージェントのトラフィックが最小限のサイトであっても、人間のユーザーや AI の引用にも影響を与える構造的およびコンテンツの問題が明らかになるため、この評価の恩恵を受けることができます。