面向可靠 AI 功能的上下文工程
· 8 分钟阅读
多数 AI 产品失败是上下文失败。把检索、记忆与指令当作系统设计。
提示词不是整个系统
当 AI 功能产生幻觉时,团队常重写系统提示。这可能有帮助,但很少触及根因。模型只能基于所给内容推理。若检索弱、记忆嘈杂或工具结果不完整,再多措辞也无法形成可靠行为。
上下文工程把组装后的输入当作产品表面。它追问哪些事实必须存在、哪些指令优先、多少历史有用、什么应排除。目标是一个有界、可检查的信息包,使预期答案成为可能。
分离指令、事实与工具
持久的上下文包有清晰所有权的分层。策略与产品指令定义模型可做什么。检索事实提供 grounding 证据。工具输出描述当前世界。对话历史捕获用户意图。把这些层混成无差别的一团,几乎无法调试。
为每层提供稳定格式与大小预算。优先结构化事实,而非长篇散文倾倒。证据冲突时保留来源,使系统可偏好权威源或提出澄清问题,而不是发明调和。
- 按决策价值而非 token 数量排序上下文
- 将授权决策放在模型之外
- 用保留承诺的摘要限制历史长度
- 记录哪些来源进入了最终提示
检索质量就是产品质量
当错误文档以高置信度被取出时,检索增强生成会静默失败。在真正重要的问题上衡量召回,而不只是嵌入相似度。纳入难点:同义词、部分标识符、多语言查询,以及本应检索为空的请求。
分块策略、元数据过滤与重排序应与模型选择同一轮评审。上下文优秀的小模型,尤其在延迟与成本约束下,往往优于上下文被污染的大模型。
让上下文可观测
用户报告糟糕答案时,工程师需要重建产生该答案的上下文。在隐私控制下存储提示与检索版本、来源标识、token 预算与校验结果。没有这条轨迹,每个事故都变成轶事。
当系统能解释它知道什么、不知道什么,以及为何如此作答时,上下文工程才算成功。这种透明是 AI 产品信任的基础。
由 Berktug Berke Ates 于 2026年8月5日 发布。