← 返回四个栏目

COLUMN 03

工程现场

把模型能力做成可靠系统:检索、工具调用、推理性能、评测与上线后的持续观测。

START WITH THIS

RAG 系统不该只看回答:建立可诊断的离线评测

把检索、生成和端到端体验拆开衡量,才能真正定位系统瓶颈。

01

TOPIC MAP

沿着这些问题继续探索

这里不是文章清单,而是一张持续生长的选题地图。标记为“拟定选题”的卡片,会随着公众号更新逐一变成正式文章。

RAG

切分策略不是参数游戏:如何让知识块真正可检索?

拟定选题

Agent

一个 Agent 上线前,必须通过的十项可靠性测试

拟定选题

推理

一次 LLM 请求的成本,到底花在了哪里?

拟定选题

LLMOps

如何为大模型应用建立回归评测集?

拟定选题

复盘

回答看似正确,用户为何依然不满意?

拟定选题