强化学习 (RL)

从 RLHF 对齐到可验证奖励与 Agentic-RL——RL 如何塑造 agent 的能力边界。

模型侧背景,取自各 RL 原论文(见下各节标注),非 harness 综述内容。RL 是近两年 agent 能力跃升的主线之一,值得独立 一章:它既是对齐(让模型听话、诚实)的手段,也是能力激发(让模型学会长链推理、工具使用、自我验证)的手段。 与 验证 (V) 的 verifier-based 环境直接相接——评估器既是度量、也是训练信号。

RLHF:三步对齐

RLHF(Reinforcement Learning from Human Feedback)由 InstructGPT(Ouyang et al., 2022,arXiv:2203.02155)确立为三步流水线:

  1. SFT(监督微调):用人工示范数据微调基座模型,得到初始策略。
  2. 奖励模型(RM):收集人类对多个模型输出的排序/比较,训练一个奖励模型来预测人类偏好。
  3. PPO 强化学习:以 RM 为奖励,用 PPO 进一步优化策略(并加 KL 惩罚防止偏离 SFT 太远)。

标志性结果:1.3B 参数的 InstructGPT 输出被人类偏好于 175B 的 GPT-3(参数少 100 倍),且在真实性上升、毒性下降的 同时几乎不损失公开 NLP 任务表现。局限:论文明确指出 InstructGPT 仍会犯简单错误——对齐不等于正确。

DPO:免 RL 循环的偏好优化

DPO(Direct Preference Optimization,Rafailov et al., 2023,arXiv:2305.18290)指出 RLHF 的 PPO 环路复杂且常不稳定, 于是对奖励做重参数化,使最优策略有闭式解,从而把整个 RLHF 问题化简为在偏好对(chosen vs rejected)上的一个 简单分类损失——不再需要独立奖励模型,也不需要在微调时从模型采样的 RL 循环。论文报告 DPO 在情感控制、摘要、单轮 对话上匹配或超过 PPO-RLHF,且更稳定、计算更轻。它是目前偏好对齐最常用的轻量替代。

奖励从何而来:结果 vs 过程

RL 的效果取决于奖励信号的质量。“Let’s Verify Step by Step”(Lightman et al., 2023,arXiv:2305.20050)对比两种监督:

  • 结果监督(outcome):只对最终答案给奖励。
  • 过程监督(process,PRM):对每一个中间推理步骤给奖励。

结论是过程监督显著优于结果监督:作者发布了 PRM800K(80 万条步级人工标注),其过程奖励模型在 MATH 测试子集上 解出 78%,并发现 active learning 能进一步提升过程监督的效率。含义:对多步推理,“哪一步错了”比“最终对不对”是更强的 训练信号——这也是后续 agentic RL 强调步级/轨迹级奖励的由来。

可验证奖励与 Agentic-RL

近期主线从“学一个奖励模型”转向可验证奖励(RLVR, RL with Verifiable Rewards):当正确性可被程序判定时(数学答案、 单元测试、编译通过),直接用这个确定性信号作奖励,绕过易被 hack 的学习式 RM。DeepSeek-R1(2025,arXiv:2501.12948, Nature 645:633-638)是代表:

  • GRPO(Group Relative Policy Optimization):从一组采样输出的相对奖励估计优势,免去独立的价值/critic 模型
  • R1-Zero:不做 SFT、纯 RL 从基座训练即涌现出长链推理、自我反思与自我验证、动态策略调整——论文主张“推理能力 可被纯 RL 激发,无需人工标注推理轨迹”。R1 则用少量 cold-start SFT 再 RL,改善可读性。
  • 结果:在数学、竞赛编程、STEM 等可验证任务上取得 SOTA,且推理能力可蒸馏到更小模型。

把这一思路从单轮推理推广到多步 agent 轨迹,就是 Agentic-RL:以任务成功/环境反馈/验证器作奖励,训练工具使用、 错误恢复、长程决策。它与 验证 (V) 的 verifier-based 环境(如 R2E-Gym、verifiers)合流 ——评估器同时充当训练奖励。

与 harness 的关系

RL 决定了模型“开箱即有”的能力边界,从而决定 harness 需要补什么。综述的观察是:模型能力提升会让部分 harness 干预 变得多余概览 的开放问题“模型进步时保持 harness 有用性”)。当 RLVR 让模型自身学会 自我验证与长链推理,一些原本靠 harness 外挂的验证/规划脚手架就可能内化进模型——RL 侧的进步因此是持续改变 harness 边际投入的上游变量。同时它与 harness 并非替代关系:可验证奖励要求“可判定正确性”的环境,而那正是 执行 (E) 沙箱与 验证 (V) 提供的基础设施。

这页有帮助吗?