老师没教,学生却学会了:一场关于AI蒸馏的乌龙实录
创始人
2026-09-09 20:14:13
0

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

2024年前后,AI训练圈子里流行起一种新玩法:让一个强大的教师模型手把手教一个学生模型做题,教师不是简单打个对错分数,而是逐字逐句地告诉学生每个字该怎么写。这种方法叫做

在线策略蒸馏

在线策略蒸馏:一种让学生模型模仿学生自己生成的答案,同时由教师模型逐词打分指导的训练方式,英文缩写OPD。

听起来很美好,对吧?教师全程盯着,字字纠正,学生想学不好都难。可Purdue大学的两位研究者Yi Ding和Ruqi Zhang做了一件挺较真的事:他们把教师打的分数一条条拆开检查,结果发现了一件让人后背发凉的事情。

教师的批改,很多时候是错的。而且教师越厉害,错得越离谱。

这事儿要是放在人类补习班里,家长早就把老师投诉了。可离谱的是,学生成绩居然照样在涨。这篇论文要讲的,就是这场"错批改却教出好学生"的乌龙是怎么回事,以及研究者们顺藤摸瓜发现的一个更朴素的真相。

教师打分为什么会错

先说清楚这套打分机制到底怎么运作的。学生模型自己生成一段回答,每写一个字,教师模型就在旁边看着这个字,给出一个

优势值

优势值:在强化学习里表示某个动作比平均水平好还是差的数值,正数代表这个词该被强化,负数代表该被压制。

具体算法是拿教师对这个字的偏好概率,和学生自己对这个字的偏好概率做一个比值再取对数,如果教师觉得这个字比学生想的更该出现,优势值就是正的,反之就是负的。这套东西背后有个专业名字叫

反向KL散度

反向KL散度:一种衡量两个概率分布差异的数学工具,这里用来衡量学生生成的文字序列和教师预期的差距,K1估计器是它的一种具体计算方式。

问题出在哪儿?教师看到的这段文字,压根不是教师自己会写出来的东西,而是学生写出来之后甩给教师去评判的。这就好比请一位数学教授去批改一份不认识的学生用他从没见过的解题思路写出来的卷子,教授看到中间某一步的时候,可能因为思路完全不熟悉,就下意识觉得"这一步写得不对",即使最终答案是对的。

研究者们专门盯着答案框里的最终结果做了统计。他们定义了一种"噪声":如果学生最终答案是对的,但教师却给这个答案的关键字打了负分;或者学生答案错了,教师反而打了正分,这就是一次噪声打分。

统计结果相当扎眼。用40亿参数规模的教师模型去批改,30.6%的批改是噪声的。换成300亿参数规模的教师,噪声率涨到34.7%。而当教师换成2350亿参数的超大模型时,噪声率飙升到50.6%,几乎是随手一批就有一半是错的。更离谱的是,这个最大的教师几乎对所有答案框里的内容都打负分,不管学生到底做对没做对,97.8%的正确答案都被打了负分,96.6%的错误答案居然也被打了负分。

如果不这样细究会发生什么?大家会继续以为教师模型越大越好,越大教得越准,可实际上教师规模越大,它对学生这种"陌生笔迹"的解读反而越走偏,因为教师和学生的语言习惯差得越来越远,教师看学生的答案就像一个只会说标准普通话的人去批改带浓重方言口音的作文,越是资深的普通话专家,可能越难适应这种偏差,反而给出更极端的判断。

学生对错误批改毫不在意

按理说,接近一半的批改都是错的,学生应该被带偏才对。研究者接下来做了个挺聪明的对照实验:他们把训练数据分成三组,一组只用有噪声的批改来训练,一组只用干净的批改来训练,一组按标准流程混着用。

结果三组学生最后考出来的成绩几乎一样。

这个发现相当反直觉。一个正常人的预期是,喂给学生错误的反馈,学生应该学得更差才对,就像给学生一份写满错误批注的作业本,学生对着这些批注去改错,改出来的东西大概率更糟。可这里学生并没有变糟,甚至进步速度和吃"干净饭"的学生差不多。

这说明了一件挺颠覆的事:学生的进步,可能压根就不是靠理解和吸收教师那些逐字逐句的批注在起作用。那真正起作用的,到底是什么呢?

拆解到底是哪些字在起作用

研究者们没有停在这个疑问上,而是往下深挖了一层,去看训练过程中每个字对应的梯度。

梯度

梯度:神经网络训练时用来指导参数更新方向和大小的数值,梯度越大代表这个地方对模型的调整影响越大,梯度接近零就意味着这个地方基本没在起作用。

他们发现整个批改分数的分布长得很奇怪:29.2%的字拿到的优势值恰好是0,还有51.7%的字优势值小到几乎可以忽略不计,也就是说超过一半的批改根本没在起作用,等于白改了。

再往下追问,这些"白改"的字都长什么样?答案是:都是学生自己写得特别有把握的字。学生对这个字信心爆棚,概率值特别高,教师看到这种字的时候,往往也会给出差不多高的概率,两边一减,差值自然趋近于零,批改也就没意义了。这就好比一个学生做1加1等于2这种题,老师看了也确实觉得没问题,批注自然是空白的,这道题根本用不上老师。

研究者干脆做了个实验验证:只挑学生最有把握的那些字来训练,不管用真实批改分数还是随便乱给的分数,学生成绩纹丝不动。也就是说,教师在这些字上批不批、批得对不对,压根不重要,因为这些地方本来就没有信息量可传递。

真正撬动进步的杠杆

那问题的重心自然就转移到了另一端:学生自己都拿不准、写得犹豫的那些字上。这些字往往拿到的是负分,因为学生生成的东西对教师来说本来就是陌生的,教师大概率会觉得这不是它想要的写法。

研究者干脆做了个更狠的测试:干脆把教师撤掉,不管学生写的是什么,只要是那20%概率最低的字,一律给一个固定的负分,比如统一给负0.5分。

结果这么简单粗暴的操作,效果居然能追上正常的教师批改。反过来如果给这些字统一打正分,模型直接崩了,前40步之内回答长度就从正常水平掉到接近于零,梯度爆炸,输出全是乱码。

这个对比说明了一件事:真正在起作用的从来不是教师那些精细的字词级点评,而是一个简单的动作,压制学生自己都没把握、随口冒出来的那些低概率词。这就像健身教练发现学员进步的真正原因不是每次纠正握杠角度的细节反馈,而是每次学员动作走形、发力点飘忽的时候,及时喊一声"停,这个姿势不对",光是这一声制止,比一堆细致入微的纠正动作还管用。

一个更精细的开关:熵

发现"压低概率就管用"之后,研究者又往前走了一步:既然低概率的字都该被压一压,那是不是应该一视同仁,给每个字一样大小的压力?

这里引入了另一个关键概念。

熵:在这里指模型对下一个字该写什么的不确定程度,熵高说明模型面前有好几个差不多合理的选项,熵低说明模型几乎认定了唯一答案。

同样是低概率的字,背后的情况可能完全不同。有的地方模型压根拿不准,好几个词的概率都差不多,随便一个都算低概率,这种是"高熵位置"。有的地方模型其实很自信,只是这次运气不好抽到了一个概率很小的候选词,这种是"低熵位置但抽中了尾部词"。

研究者设计了一个动态调整机制,让压制力度和熵挂钩:熵越高的位置,压得越狠。他们做了正反两组对照实验,一组是熵越高压得越狠,一组反过来熵越低压得越狠。结果正相关那组的表现直接把标准的教师蒸馏方法甩在身后,AIME24这个高难度数学竞赛测试集上的准确率冲到50%,而标准教师蒸馏方法只有35.13%。反过来那组不但效果差,训练过程还不稳定,中途出现明显震荡。

这就是全文最核心的方法,研究者给它起名叫

自适应策略自适应

自适应策略自适应:一种不需要任何外部教师、不需要标准答案、也不需要验证器的训练方法,英文缩写OPSA,核心做法是只压制学生自己生成内容里概率最低的那20%的字,并且根据这些字所在位置的不确定程度动态调整压制力度。

这套方法完全不需要外部监督,不需要教师模型,不需要提示答案,也不需要可验证的奖励信号,全靠模型自己审视自己写出来的东西,把没把握的地方压一压,同时视情况区别对待。

为什么压制反而不会让模型变得死板

这里有个自然会冒出来的疑问:一直压低概率词,模型会不会变得越来越保守,最后翻来覆去只会说那几句话,丧失多样性?

论文给出了很细致的分析。在高熵位置,也就是那种模型本来就犹豫不决的分叉路口,压制某个被抽中的尾部词之后,概率并不是简单地全部涌向唯一的头部词,而是在几个原本就有竞争力的候选词之间重新分配。这就好比一个班级选班长,本来五个候选人里有一个明显不靠谱的人偶尔被提名,把这个不靠谱的人筛掉之后,剩下四个靠谱候选人的支持率会重新洗牌,而不是所有票全部涌向一个人。

而在低熵位置,也就是模型本来就非常确定该写什么的地方,因为这些字压根不在"最低20%概率"的筛选范围内,根本不会被拿来训练,模型原有的自信被完好保留。

研究者用一种叫做

杰卡德距离

杰卡德距离:一种衡量两段文本内容相似程度的指标,数值越大代表两段内容差异越大,也就是多样性越高。

的指标验证了这一点,训练前后的模型在生成较长回答时,内容多样性几乎没有差别,说明这套压制策略并没有让模型变得千篇一律。

如果没有区分头部词和尾部词,会怎样?论文里做的10%消融实验给出了答案:只压制概率最低的10%字词时,这些字几乎全是那种极端冷门的词,压得太狠反而让整个分布过度收窄,熵大幅下降,进步反而受限。这也从反面证明了这套"分层压制"的必要性。

高熵位置还藏着另一层惊喜。研究者发现,模型在这些犹豫不决的分叉点上,特别容易蹦出"等等""不过""或许""再检查一下"这类反思性词汇。这些词往往是模型自我纠错、重新审视思路的信号。经过这套训练之后,模型生成这类反思词的频率明显上升,回答长度也随之变长,而回答长度和最终答案准确率之间呈现出清晰的正相关。研究者专门做了个屏蔽实验,把这些容易触发反思词的分叉位置从训练里剔除,结果回答长度的增长和准确率的提升都消失了,训练到300步左右直接崩掉。这说明这套方法真正撬动的,恰恰就是模型在关键分叉点上多想一步、多检查一遍的能力。

数据说话:效果到底有多猛

拿Qwen3-1.7B这个17亿参数的模型做基准测试,没训练之前,在AIME24这个数学竞赛题上,32次采样的平均正确率只有13.44%,32次里至少对一次的概率是40%。用了这套自适应训练之后,平均正确率跳到48.85%,相对提升263.5%,至少对一次的概率直接翻倍到80%。

放到AIME25和更难的HMMT25竞赛题上,提升幅度分别是264.4%和307.2%。换到40亿参数的Qwen3-4B模型上依然管用,AIME24平均正确率从23.33%涨到62.08%。就算是本身已经很强的Qwen3.5-9B模型,AIME24的分数也能从76.35%再往上拉到87.81%。

而且这套方法不挑食,跑到代码生成任务MBPP+和综合问答任务GPQA-Diamond上测试,同样能带来提升,说明它学到的不是某个特定题型的窍门,而是一种更通用的能力。

跟其他不需要外部监督的方法比起来,这套方法同样占优。有一种叫

测试时强化学习

测试时强化学习:一种在推理阶段直接对模型进行训练的方法,英文缩写TTRL,靠模型自己投票选出可能正确的答案来构造训练信号。

的方法虽然也不需要外部监督,但容易把模型的判断锁死在某个局部最优解上,导致"至少对一次"的概率反而下降。这篇论文提出的方法没有这个问题,因为它并不强迫模型收敛到某个自己猜的答案上,而是专注在字词层面做更细粒度的调整。

写在后面

读到教师批改噪声率超过50%这个数字的时候,我第一反应是这套蒸馏方法是不是该被判死刑了。但往下读完才发现,事情比想象中更有意思:错误批改居然不影响学习效果,这不是说明噪声不重要,而是说明真正的学习信号原本就没依赖那些批改内容,教师的存在感被严重高估了。

最让我意外的是那个正负号实验。固定给负分能让模型稳步进步,固定给正分却直接让模型崩溃到输出乱码。这种不对称性挺值得琢磨,压制错误的冲动比鼓励某个具体方向要安全得多,因为压制之后概率往哪儿走是模型自己根据剩下的合理选项决定的,而强行鼓励某个具体方向,一旦这个方向本身就是随机噪声,模型就会被硬拽着往错误的地方走。这跟教育里常听到的一个说法有点像,批评一个具体的坏习惯,往往比空泛地表扬某种模糊的好行为更容易起效。

论文里提到熵高的位置容易冒出"等等""或许"这类反思词,这个细节让我想起人在思考真正困难的问题时,嘴里也确实更容易嘟囔"等等,好像不对",而不是在做简单加法时会犹豫。这种语言习惯上的相似性,也许不只是巧合。

这套方法目前只在90亿参数以下的模型上验证过,更大规模、更复杂架构下是否依然管用,论文自己也承认还不清楚。一个已经被训练得极度自信、输出分布极度尖锐的模型,还有没有足够的"低概率尾部词"可供压制,这也是个悬而未决的问题。

如果一个学生的进步,根源不在于老师说了什么,而在于他自己反复琢磨哪里没把握、然后主动收敛那些没把握的想法,那我们平时对"好的教学"的想象,是不是也该重新审视一下?

Q&A

Q1:在线策略蒸馏中教师模型的批改为什么会出现大量错误?

A:因为教师是在批改学生自己生成的、教师从没见过的写法,这种内容对教师来说本身就是陌生的,教师容易凭自己的习惯给出误判,教师规模越大,这种偏差反而越明显,最大的2350亿参数教师批改噪声率高达50.6%。

Q2:OPSA方法具体是怎么工作的?

A:OPSA只关注学生自己生成内容里概率最低的20%的字,给这些字打负分进行压制,并且根据这些字所在位置的不确定程度(熵)动态调整压制力度,熵越高压得越狠,整个过程完全不需要外部教师、标准答案或验证器。

Q3:OPSA会不会让模型变得死板、丧失多样性?

A:不会,在高熵的分叉位置,压制某个低概率词后概率会在其他有竞争力的候选词之间重新分配,而不是全部涌向单一答案,实验用杰卡德距离验证了训练前后模型的输出多样性基本没有下降。

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...