← 返回模型进阶

PATH 05

强化学习与推理

面对数学、代码等多步任务,模型不仅要得到答案,还要探索出能被验证的过程;强化学习为这种优化提供工具。

EVOLUTION

从 RLHF、PPO 到 RLVR

理解奖励从人类偏好走向可验证结果,推理训练为什么由此获得了更密集、更可靠的反馈。

OPTIMIZATION

GRPO、DAPO 与 GSPO

从组相对优势、动态采样到序列级优化,比较这些方法在稳定性、效率与长推理训练中的取舍。