← 返回模型进阶

PATH 04

偏好对齐(DPO / RLHF)

示范回答只能告诉模型“应该做什么”;偏好数据进一步告诉它,在多个可行答案中,什么样的回答更好。

FIRST PRINCIPLE

偏好数据如何可信

理解比较对象、标注准则、分歧与偏差,避免把错误偏好写进模型。

NEXT

从奖励模型到 DPO

比较 RLHF 与 DPO 的训练目标、工程复杂度,以及各自适合的场景。