← 返回四个栏目

COLUMN 01

算法地基

从机器学习的基本语言出发,建立理解模型、训练过程与数值稳定性的底层直觉。

START WITH THIS

为什么 Attention 要除以 √d?

从方差、Softmax 饱和和梯度三个角度,理解缩放点积注意力。

01

TOPIC MAP

沿着这些问题继续探索

这里不是文章清单,而是一张持续生长的选题地图。标记为“拟定选题”的卡片,会随着公众号更新逐一变成正式文章。

训练动力学

从 SGD 到 Adam:优化器究竟替我们做了什么?

已发布阅读文章 ↗

信息论

交叉熵与 KL 散度:大模型训练里最常见的两个量

已发布阅读文章 ↗

神经网络

残差连接为何让深层网络更容易训练?

拟定选题

Transformer

位置编码:模型如何知道 token 的先后顺序?

拟定选题

训练诊断

Loss 降不下去时,先检查哪五件事?

拟定选题