一步一步来
先用路线图建立全局地图,再进入单页交互。这样学到 Attention、RAG、Agent 时不会觉得它们是散碎名词。
这是一套从零开始理解大模型技术的系列化交互课程。它的目标不是堆术语,而是把 Token、向量、Tokenizer、Attention、QKV、Transformer 和推理策略做成可观察、可操作、可逐步学习的 HTML 页面。
先用路线图建立全局地图,再进入单页交互。这样学到 Attention、RAG、Agent 时不会觉得它们是散碎名词。
每张页面尽量围绕一个核心问题展开,避免把多个新概念堆在同一页里。
尽量通过热力图、分步播放、参数滑块、矩阵高亮和对比卡片让用户自己观察变化,而不是只读文字。
能点击的卡片代表当前已经可直接访问的页面;灰色卡片表示已经排进路线图,但还在持续建设中。页面脚本加载后,这里会自动切换成完整的分阶段课程列表。
先建立整体地图,再理解文本是怎样一步步变成模型可计算的表示。
AI、大模型在整个技术谱系中的位置是什么?文本为什么要变成 Token、向量、矩阵和张量?
这一段负责把“基础表示”衔接到“模型如何学出语义结构”,避免后面直接跳进 Transformer 时断层。
神经网络如何把原始特征重新组合成隐藏表示?Embedding 为什么能把相近概念放近?语言模型训练到底在优化什么?
这是整个系列的技术心脏,集中讲清 Tokenizer、Attention、QKV、因果 Mask、位置编码、多头注意力、Residual / LayerNorm / FFN 和 Transformer Block。
模型是如何看待 token 之间的关系的?为什么 decoder 不能偷看未来?顺序信息怎样被显式注入?多个 Head 为什么更完整?注意力之外那一半又是怎样保留主干并继续加工表示的?
理解为什么模型看到的不是词,而是更稳定的 token 序列。
理解 decoder 在预测下一个 token 时,为什么只能看左边、不能看右边。
理解 Attention 本身没有顺序感,位置编码如何把“第几个”告诉模型。
对比单头混合视角与多头分工,再看 Concat + W^O 如何把不同 Head 的结果重新融合。
把“保留主干、整理尺度、再加工特征”拆成可操作实验,补齐注意力之外的另一半。
直接体验 Q、K、V、打分矩阵和最终输出,快速把注意力机制看成可以操作的过程。
这一阶段从“模型结构”转向“模型如何被训练出来”。先补自动微分、交叉熵、优化器和训练循环,再完整跑通一个端到端 Mini-GPT,最后看自回归生成和保存加载。
梯度是怎么算出来的?交叉熵为什么和 softmax 搭配?AdamW 为什么成为大模型标配?训练循环里的 batch 和 epoch 到底在做什么?一个完整可训练的 Mini-GPT 长什么样?生成时怎么选下一个字?训练到一半怎么保存和恢复?
看懂前向传播、链式法则、反向传播与梯度下降,理解参数为什么会被更新。
从 logits 到 softmax、交叉熵损失,再到著名的 p − y 梯度公式。
对比四种优化器在同一损失曲面上的收敛轨迹,理解为什么大模型偏爱 AdamW。
亲手跑一次完整的训练流水线:取一批数据、前向、算损失、反向、更新参数。
在浏览器里真实训练一个字符级 Mini-GPT,从输入文本到自回归生成,全流程闭环。
理解贪心解码、温度、Top-K、Top-p 四种策略如何影响生成的每一个字。
检查点包含什么、序列化怎么做、优化器状态如何恢复,理解继续训练的完整流程。
把单个模型能力放进真实产品系统中,看懂评测、过拟合、安全边界、RAG、Tool Use、Agent 与部署。
怎么知道模型真的学会了?它是不是只会背训练数据?会不会被提示注入绕过?一个“可用的大模型系统”还需要检索、工具、评测和工程权衡。
先知道自己到底要学哪几个层次,再去学具体机制。
搞清文本如何变成 token、向量、矩阵和张量。
补上神经网络、Embedding 和语言模型目标这层直觉,再进入 Transformer。
进入 Attention、QKV、因果 Mask、位置编码、多头注意力、Residual / LayerNorm / FFN 和 Block 结构。
学会自动微分、交叉熵、AdamW 和训练循环,再亲手跑通一个端到端 Mini-GPT,理解自回归生成和检查点保存。
最后看过拟合检测、安全边界、RAG、工具调用、Agent 与部署。