训练方法

通过更新权重塑造模型默认能力的方法——预训练、SFT/指令微调、工具增强训练;对齐与奖励优化见强化学习。

模型侧背景。训练方法通过更新模型权重改变其默认能力,是 harness 之下、比 推理范式 更靠近模型的一层。本篇覆盖基础训练与工具增强训练;对齐与奖励优化(RLHF/DPO/过程奖励/RLVR/Agentic-RL)自成主线, 见 强化学习。harness 综述有意不综述模型训练,仅在 T 层 §4.3 触及工具增强训练。

基础训练:预训练 → SFT → 指令微调

  • 预训练:在大规模语料上做下一 token 预测,习得语言与世界知识,得到基座模型——这是所有下游能力的底座。
  • SFT(监督微调)/指令微调:在“指令-示范”数据上微调,让模型从“续写”转为“听指令、按期望格式作答”。这一步是后续 对齐(RLHF 的第一步就是 SFT)与 agent 行为的前提——没有稳定的指令跟随,工具调用与多步执行都无从谈起。

工具增强训练

让“何时/如何调用工具”成为可学习的能力,而非硬编码进固定 API 包裹:

  • Toolformer:自监督地学习在生成中何处插入 API 调用。
  • Gorilla、ToolLLM/ToolBench:以更大工具语料 + 指令微调 + 执行导向监督,训练模型在大量 API 间正确选择与调用。

此项在 harness 综述中归入 T 层 的“工具增强训练”方向;这里作模型侧交叉引用,说明工具能力 由预训练/微调信号、接口 schema 质量、运行时选择策略共同决定,只改一处收益有限。

对齐与奖励优化(见强化学习)

把模型对齐到人类偏好、并激发长链推理/自我验证等 agent 能力,主要靠强化学习家族(RLHF、DPO、过程奖励模型、可验证奖励 RLVR、Agentic-RL)。因其对 agent 能力边界影响过大,单列一章展开:见 强化学习

与 harness 的关系

训练方法决定了模型“开箱即有”的能力边界,从而决定 harness 需要补什么。综述的观察是:模型能力提升会让部分 harness 干预变得多余概览 的开放问题“模型进步时保持 harness 有用性”,并举 Opus 4.5→4.6 移除 sprint 与上下文重置、成本 $200→$125 为例)。因此训练侧的进步不是与 harness 无关的背景,而是持续改变 harness 边际投入 的上游变量。

这页有帮助吗?