SimLabs LLM Visual

SimLabs LLM 可视化

这是一套从零开始理解大模型技术的系列化交互课程。它的目标不是堆术语,而是把 Token、向量、Tokenizer、Attention、QKV、Transformer 和推理策略做成可观察、可操作、可逐步学习的 HTML 页面。

路线先行,不会迷路 先直觉,再公式,再工程 适合教学、自学和演示

这个系列的学习方式

一步一步来

先用路线图建立全局地图,再进入单页交互。这样学到 Attention、RAG、Agent 时不会觉得它们是散碎名词。

每页只讲一件事

每张页面尽量围绕一个核心问题展开,避免把多个新概念堆在同一页里。

动手看变化

尽量通过热力图、分步播放、参数滑块、矩阵高亮和对比卡片让用户自己观察变化,而不是只读文字。

当前建设状态: 技术地图、Token/向量、矩阵基础、张量 Tensor、神经网络基础、Embedding 语义空间、语言模型目标、Tokenizer、Attention 直觉、QKV、因果 Mask、位置编码、多头注意力、Residual / LayerNorm / FFN、Transformer Block、解码策略、训练与对齐、自动微分与计算图、交叉熵与反向传播、SGD / AdamW、训练循环、端到端 Mini-GPT、自回归生成与采样、保存加载与继续训练、评测与安全边界、RAG、Tool Use、Agent、安全、评测、部署与成本都已上线。

完整路线图

能点击的卡片代表当前已经可直接访问的页面;灰色卡片表示已经排进路线图,但还在持续建设中。页面脚本加载后,这里会自动切换成完整的分阶段课程列表。

阶段 1 · 基础底座

先建立整体地图,再理解文本是怎样一步步变成模型可计算的表示。

已上线 4 页

核心问题

AI、大模型在整个技术谱系中的位置是什么?文本为什么要变成 Token、向量、矩阵和张量?

地图认知 Token 矩阵基础 张量

阶段 2 · 表示学习

这一段负责把“基础表示”衔接到“模型如何学出语义结构”,避免后面直接跳进 Transformer 时断层。

已上线 3 页

核心问题

神经网络如何把原始特征重新组合成隐藏表示?Embedding 为什么能把相近概念放近?语言模型训练到底在优化什么?

神经网络 Embedding 语言模型目标

阶段 3 · Transformer 核心

这是整个系列的技术心脏,集中讲清 Tokenizer、Attention、QKV、因果 Mask、位置编码、多头注意力、Residual / LayerNorm / FFN 和 Transformer Block。

已上线 8 页

核心问题

模型是如何看待 token 之间的关系的?为什么 decoder 不能偷看未来?顺序信息怎样被显式注入?多个 Head 为什么更完整?注意力之外那一半又是怎样保留主干并继续加工表示的?

Tokenizer Attention Mask 位置编码 多头注意力 Residual / LayerNorm / FFN Transformer Block

阶段 4 · 训练与推理

这一阶段从“模型结构”转向“模型如何被训练出来”。先补自动微分、交叉熵、优化器和训练循环,再完整跑通一个端到端 Mini-GPT,最后看自回归生成和保存加载。

已上线 7 页

核心问题

梯度是怎么算出来的?交叉熵为什么和 softmax 搭配?AdamW 为什么成为大模型标配?训练循环里的 batch 和 epoch 到底在做什么?一个完整可训练的 Mini-GPT 长什么样?生成时怎么选下一个字?训练到一半怎么保存和恢复?

自动微分 交叉熵 反向传播 AdamW 训练循环 Mini-GPT 采样策略 检查点

阶段 5 · 评测、安全与应用系统

把单个模型能力放进真实产品系统中,看懂评测、过拟合、安全边界、RAG、Tool Use、Agent 与部署。

已上线 6 页

核心问题

怎么知道模型真的学会了?它是不是只会背训练数据?会不会被提示注入绕过?一个“可用的大模型系统”还需要检索、工具、评测和工程权衡。

评测 过拟合 安全边界 RAG Tool Use Agent Evals

推荐的起步顺序

1

技术地图

先知道自己到底要学哪几个层次,再去学具体机制。

2

文本表示

搞清文本如何变成 token、向量、矩阵和张量。

3

表示学习

补上神经网络、Embedding 和语言模型目标这层直觉,再进入 Transformer。

4

Transformer 核心

进入 Attention、QKV、因果 Mask、位置编码、多头注意力、Residual / LayerNorm / FFN 和 Block 结构。

5

训练与推理

学会自动微分、交叉熵、AdamW 和训练循环,再亲手跑通一个端到端 Mini-GPT,理解自回归生成和检查点保存。

6

评测、安全与系统

最后看过拟合检测、安全边界、RAG、工具调用、Agent 与部署。

一句话理解本系列: 不是把论文原文搬上网页,而是把抽象概念变成你能自己点、自己看、自己验证的学习体验。