8.1 通用模型的行动缺陷:从文本续写到行动决策的认知鸿沟
本节要点:为什么在公开问答榜单上跑分极高的通用大模型,一进入真实的 Agent 工具调用场景就频频翻车?深度透视预训练目标(Next-Token Prediction)与行动决策目标之间的本质冲突;剖析通用模型在工具格式遵循、长程因果一致性与环境容错自愈上的三大硬伤;明确 Agent 专用模型后训练(Post-Training)的必要性。
1. 目标错位:文本续写 vs. 物理行动决策
所有主流大语言模型在预训练阶段的核心优化目标都是因果语言建模(Next-Token Prediction):
Loss = - Σ log P( token_t | token_<t )模型被训练为预测人类互联网文本中最可能出现的下一个词。然而,这与智能体(Agent)所处决策环境的目标函数存在巨大的认知鸿沟:
2. 通用模型作为 Agent 时的三大天然顽疾
如果未经专门的 Agent 后训练,直接拿通用基座模型进行复杂工具交互,系统会迅速暴露三大软肋:
2.1 格式与工具幻觉 (Tool Hallucination)
通用模型在面对系统注入的 10 个工具时,极其容易凭空捏造不存在的函数(如系统只提供了 view_file,模型却自作聪明调用 open_file_and_display),或者输出无法通过 JSON.parse 校验的残缺入参。
2.2 错误反思的“道歉复读机”死循环
当工具返回一个真实报错(如 Error: File not found)时:
- 经过 RLHF 对齐的人类聊天模型具有极强的“讨好型人格”;
- 它会立刻输出:“非常抱歉给您带来了不便,我犯了一个错误,接下来我将重新为您查询……”
- 但在下一轮循环中,它依然传入一模一样的错误参数,再次撞墙报错,直至耗尽最大重试轮次。
2.3 状态漂移与终止钝化 (Lack of Stopping Awareness)
通用模型无法准确判定“任务到底在哪个物理时刻算彻底完成”。 它常常在已经成功修复 Bug、测试全绿之后,依然停不下来,继续自作主张去格式化其他无关代码,最终引入新的编译错误破坏现场。
3. 后训练的战略价值:从概率预测器锻造为马尔可夫决策策略
要让模型成为真正的“数字员工”,必须经历专门的 Agent 模型后训练(Agent Post-Training):
- SFT 阶段(教规矩):教会模型严格输出标准的 Tool Call 格式,在遇到常见报错时立刻启动二分法排查;
- 强化学习阶段(练智谋):让模型在数万个沙箱测试中自我对弈试错,自发涌现出跨步骤规划、回溯撤销与深度思考(Long Thinking Chain)的超级能力。
4. 本节练习与反思
Interactive Practice · 概念巩固
为什么纯粹以人类问答喜好度对齐(标准 RLHF)的通用大模型,在遇到工具执行报错时经常退化为'道歉复读机'而无法自愈?
Interactive Practice · 概念巩固
在 Agent 场景中,'终止意识钝化(Lack of Stopping Awareness)'通常会导致什么严重的系统后果?
Last updated on