模型与系统笔记
栏目
文章
关于
← 返回模型进阶
PATH 04
偏好对齐(DPO / RLHF)
示范回答只能告诉模型“应该做什么”;偏好数据进一步告诉它,在多个可行答案中,什么样的回答更好。
FIRST PRINCIPLE
偏好数据如何可信
理解比较对象、标注准则、分歧与偏差,避免把错误偏好写进模型。
NEXT
从奖励模型到 DPO
比较 RLHF 与 DPO 的训练目标、工程复杂度,以及各自适合的场景。