对齐路线
COLUMN 02
模型进阶
从监督微调到偏好优化与强化学习,理解模型能力如何被塑造、约束和评测。
TOPIC MAP
沿着这些问题继续探索
这里不是文章清单,而是一张持续生长的选题地图。标记为“拟定选题”的卡片,会随着公众号更新逐一变成正式文章。
数据工程
一份好的指令数据,究竟应该长什么样?
拟定选题强化学习
奖励模型学到的,真的是人类偏好吗?
拟定选题评测
微调后模型变聪明了,还是只会迎合评测集?
拟定选题训练工程
COLUMN 02
从监督微调到偏好优化与强化学习,理解模型能力如何被塑造、约束和评测。
TOPIC MAP
这里不是文章清单,而是一张持续生长的选题地图。标记为“拟定选题”的卡片,会随着公众号更新逐一变成正式文章。
对齐路线
数据工程
强化学习
评测
训练工程