对齐路线
COLUMN 02
模型进阶
从 Prompt 工程、SFT 到偏好对齐、强化学习与 Agent 训练,理解模型能力如何被塑造。
LEARNING PATHS
六条能力塑造路径
从“如何使用模型”走到“如何验证它是否真的变好”。选择一条路径,进入可按顺序阅读、持续补全的独立章节。
PATH 01
Prompt 工程与上下文设计
不训练,能否先把模型用对?- 指令、示例与上下文
- 结构化输出与约束
PATH 02
数据工程与 SFT
需要教模型正确答案时,数据如何设计?- 指令数据与数据质量
- SFT 与领域续训
PATH 03
高效微调(PEFT)
如何以可控成本改变模型?- Full FT、LoRA、QLoRA
- 目标模块与超参数
PATH 04
偏好对齐(DPO / RLHF)
如何让模型学会更符合人类偏好?- 偏好数据与奖励模型
- DPO 与 RLHF
PATH 05
强化学习与推理
如何优化复杂、多步任务的过程与结果?- PPO、GRPO、DAPO、GSPO
- RLVR 与过程奖励
PATH 06
Agent 训练与后训练
如何让模型学会调用工具并完成多步任务?- Tool-use SFT 与轨迹数据
- 环境反馈与 Agent RL
OPEN QUESTIONS
沿着这些问题继续探索
这些选题不按路径排列,适合从当下最关心的具体问题切入。
数据工程
一份好的指令数据,究竟应该长什么样?
拟定选题强化学习
奖励模型学到的,真的是人类偏好吗?
拟定选题评测
微调后模型变聪明了,还是只会迎合评测集?
拟定选题训练工程