Skip to content
Berktug Berke Ates
Berktug Berke Ates

软件工程师

博客

不靠猜测评估生产环境中的 LLM 输出

· 8 分钟阅读

用反映真实产品风险的评估套件,取代凭感觉上线。

定义真正重要的属性

通用准确率分数很少能保护产品。决定用户与业务不能妥协的属性:事实 grounding、schema 有效性、语气、拒绝质量、延迟、引用存在或策略合规。不同功能需要不同记分卡。

将这些属性写成可度量检查。有 grounding 的答案应引用允许的来源。预订助手绝不能虚构库存。支持助手应拒绝账户接管请求。评估始于产品承诺,而非模型排行榜。

构建活的数据集

从生产问题、支持工单、对抗性提示与研究中发现的边界案例收集样本。将个人身份信息排除在套件外,或以逼真的合成替代品替换。与提示词和模型设置一起版本化数据集。

纳入应优雅失败的案例。只覆盖快乐路径的评估,会在最损害信任的时刻放行回归。

  • 将离线套件与在线采样分开
  • 用定期人工审阅校准自动评分器
  • 在关键属性回归时阻断发布
  • 按用户旅程跟踪评估覆盖率

自动化枯燥部分,审阅微妙部分

Schema 检查、禁用短语检测、引用存在与确定性夹具可在每次变更运行。有用性或同理心等细微品质仍需抽样人工判断。用自动化扩大覆盖,用人保持评分器诚实。

当模型或提示变更时,与先前基线比较,而非与绝对完美幻想比较。问题是产品对你服务的用户是否更安全、更有用。

上线后闭环

生产会发明套件从未设想的案例。尽快将高严重度失败回灌评估。并与遥测配对:点踩率、用户纠正的编辑距离、升级到人工,以及任务完成。

评估不是上线前的仪式。它是 AI 产品持续的免疫系统。


由 Berktug Berke Ates 于 2026年1月28日 发布。