# 不靠猜测评估生产环境中的 LLM 输出

用反映真实产品风险的评估套件，取代凭感觉上线。

Published: 2026-01-28

## 定义真正重要的属性

通用准确率分数很少能保护产品。决定用户与业务不能妥协的属性：事实 grounding、schema 有效性、语气、拒绝质量、延迟、引用存在或策略合规。不同功能需要不同记分卡。

将这些属性写成可度量检查。有 grounding 的答案应引用允许的来源。预订助手绝不能虚构库存。支持助手应拒绝账户接管请求。评估始于产品承诺，而非模型排行榜。

## 构建活的数据集

从生产问题、支持工单、对抗性提示与研究中发现的边界案例收集样本。将个人身份信息排除在套件外，或以逼真的合成替代品替换。与提示词和模型设置一起版本化数据集。

纳入应优雅失败的案例。只覆盖快乐路径的评估，会在最损害信任的时刻放行回归。

- 将离线套件与在线采样分开
- 用定期人工审阅校准自动评分器
- 在关键属性回归时阻断发布
- 按用户旅程跟踪评估覆盖率

## 自动化枯燥部分，审阅微妙部分

Schema 检查、禁用短语检测、引用存在与确定性夹具可在每次变更运行。有用性或同理心等细微品质仍需抽样人工判断。用自动化扩大覆盖，用人保持评分器诚实。

当模型或提示变更时，与先前基线比较，而非与绝对完美幻想比较。问题是产品对你服务的用户是否更安全、更有用。

## 上线后闭环

生产会发明套件从未设想的案例。尽快将高严重度失败回灌评估。并与遥测配对：点踩率、用户纠正的编辑距离、升级到人工，以及任务完成。

评估不是上线前的仪式。它是 AI 产品持续的免疫系统。
