← 返回模型进阶

PATH 06

Agent 训练与后训练

Agent 不只是把工具接到模型上。要让模型稳定完成多步任务,还需要学习工具调用轨迹、环境反馈与长程决策。

FIRST PRINCIPLE

先学会调用,再学会行动

从 Tool-use SFT 与高质量轨迹数据出发,定义模型如何选择工具、组织参数与读取结果。

NEXT

让环境反馈进入训练

把任务成功、工具执行与轨迹质量转为奖励信号,理解 Agent RL 的训练对象与难点。