← 返回四个栏目

COLUMN 02

模型进阶

从 Prompt 工程、SFT 到偏好对齐、强化学习与 Agent 训练,理解模型能力如何被塑造。

START WITH THIS

LoRA 微调:先回答这五个问题,再开始训练

微调的关键不是先找参数,而是先明确任务、数据和成功标准。

01

LEARNING PATHS

六条能力塑造路径

从“如何使用模型”走到“如何验证它是否真的变好”。选择一条路径,进入可按顺序阅读、持续补全的独立章节。

OPEN QUESTIONS

沿着这些问题继续探索

这些选题不按路径排列,适合从当下最关心的具体问题切入。

对齐路线

SFT、DPO、PPO:大模型对齐方法如何选择?

拟定选题

数据工程

一份好的指令数据,究竟应该长什么样?

拟定选题

强化学习

奖励模型学到的,真的是人类偏好吗?

拟定选题

评测

微调后模型变聪明了,还是只会迎合评测集?

拟定选题

训练工程

显存不够时:从 batch size 到 QLoRA 的决策顺序

拟定选题