Skip to content
Berktug Berke Ates
Berktug Berke Ates

ソフトウェアエンジニア

ブログ

当て推量なしでLLM出力を評価する

· 8分で読める

バイブスに基づく出荷を、実プロダクトリスクを反映する評価スイートに置き換えろ。

重要なプロパティを定義する

一般的な精度スコアがプロダクトを守ることは稀だ。ユーザーとビジネスが妥協できないプロパティを決めろ:事実グラウンディング、スキーマ妥当性、トーン、拒否品質、レイテンシ、引用の有無、ポリシー準拠。機能ごとにスコアカードは異なる。

これらのプロパティを測定可能なチェックとして書け。根拠ある回答は許可されたソースを引用すべきだ。予約アシスタントは在庫を発明してはならない。サポートヘルパーはアカウント乗っ取り要求を拒否すべきだ。評価はモデルのリーダーボードではなく、プロダクト約束から始まる。

生きたデータセットを構築する

本番問題、サポートチケット、敵対的プロンプト、調査で見つかったエッジケースから例を集めろ。個人識別情報はスイートから外すか、現実的な合成代替に置き換えろ。プロンプトとモデル設定と一緒にデータセットをバージョン管理しろ。

優雅に失敗すべきケースを含めろ。ハッピーパスだけを覆う評価は、信頼を最も損なう瞬間の回帰をグリーンライトする。

  • オフラインスイートとオンラインサンプリングを分ける
  • 定期的な人のレビューで自動グレーダーを校正する
  • 重要なプロパティ回帰でリリースをブロックする
  • ユーザージャーニーごとの評価カバレッジを追跡する

退屈なものは自動化し、微妙なものはレビューする

スキーマチェック、禁止句検出、引用の有無、決定的フィクスチャは変更のたびに走らせられる。有用性や共感のようなニュアンスは、なおサンプリングした人の判断が要る。自動化でカバレッジを広げ、人でグレーダーを正直に保て。

モデルやプロンプトが変わったら、絶対的な完璧の幻想ではなく、以前のベースラインと比較しろ。問いは、あなたが仕えるユーザーにとってプロダクトがより安全で有用になったかだ。

ローンチ後にループを閉じる

本番はスイートが想像しなかったケースを発明する。高重大度の失敗をすばやく評価に戻せ。テレメトリとペアにしろ:サムズダウン率、ユーザー訂正の編集距離、人へのエスカレーション、タスク完了。

評価はローンチ前の儀式ではない。AIプロダクトの継続的な免疫系だ。


2026年1月28日、Berktug Berke Ates が公開。