不靠猜测评估生产环境中的 LLM 输出
· 8 分钟阅读
用反映真实产品风险的评估套件,取代凭感觉上线。
定义真正重要的属性
通用准确率分数很少能保护产品。决定用户与业务不能妥协的属性:事实 grounding、schema 有效性、语气、拒绝质量、延迟、引用存在或策略合规。不同功能需要不同记分卡。
将这些属性写成可度量检查。有 grounding 的答案应引用允许的来源。预订助手绝不能虚构库存。支持助手应拒绝账户接管请求。评估始于产品承诺,而非模型排行榜。
构建活的数据集
从生产问题、支持工单、对抗性提示与研究中发现的边界案例收集样本。将个人身份信息排除在套件外,或以逼真的合成替代品替换。与提示词和模型设置一起版本化数据集。
纳入应优雅失败的案例。只覆盖快乐路径的评估,会在最损害信任的时刻放行回归。
- 将离线套件与在线采样分开
- 用定期人工审阅校准自动评分器
- 在关键属性回归时阻断发布
- 按用户旅程跟踪评估覆盖率
自动化枯燥部分,审阅微妙部分
Schema 检查、禁用短语检测、引用存在与确定性夹具可在每次变更运行。有用性或同理心等细微品质仍需抽样人工判断。用自动化扩大覆盖,用人保持评分器诚实。
当模型或提示变更时,与先前基线比较,而非与绝对完美幻想比较。问题是产品对你服务的用户是否更安全、更有用。
上线后闭环
生产会发明套件从未设想的案例。尽快将高严重度失败回灌评估。并与遥测配对:点踩率、用户纠正的编辑距离、升级到人工,以及任务完成。
评估不是上线前的仪式。它是 AI 产品持续的免疫系统。
由 Berktug Berke Ates 于 2026年1月28日 发布。