← 返回四个栏目

COLUMN 02

模型进阶

从监督微调到偏好优化与强化学习,理解模型能力如何被塑造、约束和评测。

START WITH THIS

LoRA 微调:先回答这五个问题,再开始训练

微调的关键不是先找参数,而是先明确任务、数据和成功标准。

01

TOPIC MAP

沿着这些问题继续探索

这里不是文章清单,而是一张持续生长的选题地图。标记为“拟定选题”的卡片,会随着公众号更新逐一变成正式文章。

对齐路线

SFT、DPO、PPO:大模型对齐方法如何选择?

拟定选题

数据工程

一份好的指令数据,究竟应该长什么样?

拟定选题

强化学习

奖励模型学到的,真的是人类偏好吗?

拟定选题

评测

微调后模型变聪明了,还是只会迎合评测集?

拟定选题

训练工程

显存不够时:从 batch size 到 QLoRA 的决策顺序

拟定选题