① 评测:怎么知道它真的行
训练 loss 低不代表泛化好。需要在没见过的数据上测。验证集和测试集就是用来干这个的。
上一页我们把模型保存下来了。但一个能跑通的模型,不等于一个能用的模型。它可能只是在背训练数据(过拟合),可能在验证集上表现很差(欠拟合),也可能被用户一句“忽略之前所有指令”就绕过了安全限制。这一页会把模型上线前的三道关键关卡——评测、过拟合检测、安全边界——拆成可以亲手操作的实验。
训练循环跑通、loss 在下降、模型能生成文字,这只是“能跑”。一个真正能上线的模型,还必须通过三道关:它有没有真的学会(评测)、它是不是只会背答案(过拟合)、它会不会被恶意绕过(安全)。
训练 loss 低不代表泛化好。需要在没见过的数据上测。验证集和测试集就是用来干这个的。
模型可能把训练数据一字不差地背下来,遇到新数据就崩。这就是过拟合,是深度学习最常见的失败模式。
一个能生成文字的系统,也可能被诱导生成有害内容、泄露隐私、被提示注入绕过。安全边界决定它能不能被放心使用。
下面用两条曲线模拟训练过程。蓝色是训练集 loss,绿色是验证集 loss。模型容量越大,越容易记住训练数据。拖动容量滑块,观察两条曲线什么时候开始分道扬镳——那就是过拟合的起点。
同一个模型,在不同容量和数据量下,会呈现三种典型状态。下面用三张缩略曲线把它们并排放在一起对比。
训练 loss 和验证 loss 都停在较高位置,两条线紧贴。模型容量太小或训练不够,根本没学到规律。
训练 loss 低,验证 loss 也低,两者差距小。模型学到了真实规律,泛化能力好。这是理想状态。
训练 loss 极低,但验证 loss 在某点后急剧上升,两条线差距越来越大。模型在背训练数据,泛化极差。
一个大模型即使评测分数很高,如果被用户轻易绕过安全限制,也不能上线。下面是一个模拟的安全过滤器。在输入框中输入或点击样例,实时观察五个安全维度的风险评分,以及最终的处置建议。
不同任务需要不同的评测指标。下面列出语言模型最常用的七个指标,以及它们分别衡量什么。
| 指标 | 定义 | 衡量什么 | 典型用途 |
|---|---|---|---|
| Loss | −log(ptarget) | 预测正确 token 的概率 | 训练监控、验证集评估 |
| PPL | exp(Loss) | 模型“困惑”程度,越低越好 | 语言模型预训练、对比不同模型 |
| Accuracy | 正确数 / 总数 | 分类正确的比例 | 分类任务、意图识别 |
| F1 | 2PR/(P+R) | 精确率和召回率的平衡 | 类别不平衡、信息抽取 |
| BLEU | n-gram 重合度 | 生成文本与参考的相似度 | 机器翻译、文本摘要 |
| ROUGE | 召回率导向 | 参考中的内容被覆盖多少 | 摘要、问答 |
| Pass@k | k 次中通过率 | 代码是否通过单元测试 | 代码生成、数学推理 |
下面用六张卡片,把评测、过拟合、安全边界相关的每一个概念完整讲清楚。
评测(Evaluation)是在未参与训练的数据上衡量模型性能的过程。标准做法是把数据划分为训练集(用于更新参数)、验证集(用于调参和早停)、测试集(最终评估,只能用一次)。
过拟合(Overfitting)指模型在训练集上表现极好但在验证集上表现差,本质是记住了训练数据的噪声而非真实规律。欠拟合(Underfitting)指模型太简单,训练集和验证集都表现差。
安全边界(Safety Boundary)是模型在有害内容、提示注入、隐私泄露、偏见歧视等方面的防护能力。常用技术包括:安全分类器、RLHF 对齐、提示词过滤、输出审核、红队测试。
评测就像考试:训练集是课本,验证集是模拟考,测试集是高考。你可以在模拟考上反复调整学习方法,但高考只有一次,用来检验你真正的水平。
过拟合就像学生把课本上的题目答案全背下来了,模拟考遇到原题满分,但换一道新题就不会做。欠拟合就像学生根本没学懂,课本上的题也不会做。
安全边界就像门口保安:正常访客放行,可疑人员拦下,危险分子报警。大模型也会被“坏人”用各种话术绕过,所以必须有一层独立于模型的安检系统。
它解决了“如何判断一个模型能不能被放心使用”这个问题。
评测和安全是模型从实验室走向生产环境的最后一道关。没有它们,你无法知道模型到底行不行,也无法保证它不会造成伤害。
它影响:
在大模型时代,安全评测已经从“可选项”变成“必选项”。OpenAI、Anthropic、Google 都有专门的安全团队和红队流程。
必须看验证集和测试集。训练/验证 loss 差距持续变大,就是过拟合的明确信号。
在验证 loss 开始上升时停止训练,不需要改模型结构,不需要额外计算,几乎零成本。
不能只靠模型自己拒绝。要在输入和输出两端加独立的安全分类器,才能防御提示注入和越狱。