Skip to content
Berktug Berke Ates
Berktug Berke Ates

ソフトウェアエンジニア

ブログ

虚栄指標なしで検索品質を測る

· 7分で読める

埋め込み類似度とデモのクリックは、検索がユーザーの助けになっていることを証明しません。タスク成功、根拠付き回答率、何も返すべきハードネガティブを測ってください。

類似は有用ではない

クエリとチャンクのコサイン類似度は、インデックスがベクトル空間で近いものを取ったとしか言いません。チャンクがユーザータスク完了に必要な事実を含むか、引用が忠実か、システムが何も取るべきでなかったかは言いません。類似だけを最適化すると流暢な無関係を報います。

スタッフ級の測定はプロダクト約束から始まります。機能がコーパスからの根拠付き回答を主張するなら、指標はノートブックの近傍の美しさではなく、現実的クエリ下の正しいグラウンディングです。

あなたを失敗させうる評価セットを作る

期待ドキュメントIDや回答属性でクエリセットをラベルし、敵対ケースも含めます:同義語、古いエンティティ、部分識別子、多言語表現、答えのない質問。必須ドキュメントのrecall@k、引用のprecision、何もマッチすべきでないときの棄権精度を追跡します。

プロダクトが変わるたびにセットを刷新します。ローンチ週の凍結ゴールデンセットは、コンテンツとユーザー言語がドリフトすると虚栄になります。回帰を帰属できるよう、データセットをインデックスとチャンク戦略と共に版管理します。

  • テナント・言語・コンテンツ種別・リスク階層でスライス報告する
  • 各リリースゲートに「何も取得すべきでない」ケースを含める
  • オフラインスコアを本番サンプルの人手レビューと組む
  • インシデントレビューで検索失敗と生成失敗を分ける

オンライン指標は成果に結びつく必要がある

AI回答後にユーザーが仕事を終えるか、再生成の頻度、検索やサポートへのエスカレーション、引用訂正を計測します。文体への高評価は、事実が誤っているときのチケット増と共存し得ます。孤立したエンゲージメント虚栄より成果連動率を好みます。

チャンク、埋め込み、リランカーを変えるときは、明確な成功基準でペア実験を回します。レイテンシと成功した根拠付き回答あたりコストの回帰を防ぎます—五回の再生成を強いる安い検索は安くありません。

検索を本番依存として運用する

インデックス鮮度、権限フィルタ、空結果率はAPI可用性と同じダッシュボードに属します。クローラやACL変更後のサイレントなrecall低下は、モデルが自信ある散文を出していてもプロダクトインシデントです。

虚栄指標はチームを忙しそうに見せます。有用な指標は決定させます:出す、戻す、またはコンテンツとチャンクに投資する。その決定品質こそ検索を測る意味です。


2026年9月9日、Berktug Berke Ates が公開。