模型与系统笔记
栏目
文章
关于
← 返回模型进阶
PATH 06
Agent 训练与后训练
Agent 不只是把工具接到模型上。要让模型稳定完成多步任务,还需要学习工具调用轨迹、环境反馈与长程决策。
FIRST PRINCIPLE
先学会调用,再学会行动
从 Tool-use SFT 与高质量轨迹数据出发,定义模型如何选择工具、组织参数与读取结果。
NEXT
让环境反馈进入训练
把任务成功、工具执行与轨迹质量转为奖励信号,理解 Agent RL 的训练对象与难点。