Skip to content
Berktug Berke Ates
Berktug Berke Ates

软件工程师

博客

打造赢得信任的 AI 产品工程

· 8 分钟阅读

面向生产环境中有用、可观测、可靠的 AI 功能的实用架构。

模型只是一个组件

有说服力的原型可以围绕单次模型调用构建。可靠产品不行。生产 AI 嵌在更大系统中:输入校验、上下文组装、策略执行、检索、生成、后处理、持久化、分析与恢复。模型可能是最显眼的组件,但产品质量由它们之间的契约决定。

这改变了工程问题。不要问哪个提示产出最惊艳的答案,而要问系统承诺什么、如何度量该承诺,以及置信度低时会发生什么。强架构使不确定性显式。它把生成输出当作不可信数据,校验其形状,并把确定性业务规则留在模型边界之外。

先设计契约,再写提示

从用户结果出发并向后推导。定义功能真正需要的输入、界面可安全渲染的输出 schema、延迟与成本预算、禁止行为,以及降级体验。带有界字段的类型化响应,比每次运行含义都变的散文块更容易测试。

契约还应分离事实与解释。检索到的账户数据、产品记录或医学引用需要来源。生成建议需要反映其置信度与目的的清晰语言。类别混杂时,用户分不清哪部分有 grounding,工程师也无法诊断答案为何失败。

  • 在运行时校验模型输出
  • 将提示、schema 与评估数据集一并版本化
  • 保持授权与定价规则确定性
  • 提供有用的非 AI 降级路径

评估是交付的一部分

AI 质量不能简化为单元测试,但这不意味着不可测。从真实产品场景构建代表性评估集:常见请求、模糊输入、对抗措辞、多语言案例、缺失上下文与高风险边界条件。对用户关心的属性打分,如正确性、相关性、语气、groundedness 与拒绝行为。

每当模型、系统提示、检索策略或输出 schema 变更时运行该套件。自动评分器可加速反馈,而有针对性的人工审阅校准评分器并捕获微妙的产品回归。目标不是神奇的通用分数,而是可重复的决策过程,防止局部惊艳的变更静默劣化整体体验。

把功能当作系统来运营

可观测性应跟随请求穿越整条管道,且不存储不必要的敏感内容。跟踪模型与提示版本、检索结果、schema 校验、延迟、token 用量、降级率、用户纠正与下游动作。产品分析告诉你功能是否有价值;运维遥测告诉你是否健康。

速率限制、熔断器、超时、缓存与优雅降级不是次要关切。它们使模型中断或成本飙升不致变成产品中断。成熟的 AI 工程更少隐藏不确定性,更多遏制它。

信任会复利

用户通过反复的小互动学习产品是否值得信任。清晰边界、可预测行为、快速恢复与诚实解释,比偶发的惊艳更重要。最好的 AI 体验往往显得克制:在模糊处用智能,在需要精确处用常规软件。

这种克制也是竞争优势。模型会快速变化;设计良好的评估与运营层,让产品能采用更好模型,而无需每次重建身份。


由 Berktug Berke Ates 于 2026年7月14日 发布。