模型与系统笔记
栏目
文章
关于
← 返回模型进阶
PATH 05
强化学习与推理
面对数学、代码等多步任务,模型不仅要得到答案,还要探索出能被验证的过程;强化学习为这种优化提供工具。
EVOLUTION
从 RLHF、PPO 到 RLVR
理解奖励从人类偏好走向可验证结果,推理训练为什么由此获得了更密集、更可靠的反馈。
OPTIMIZATION
GRPO、DAPO 与 GSPO
从组相对优势、动态采样到序列级优化,比较这些方法在稳定性、效率与长推理训练中的取舍。