关闭广告

港中文联手腾讯AI实验室揭秘:为什么你的AI老师越厉害,学生反而学得越差?

科技行者2026-07-28 00:00:013人阅读


这项由香港中文大学与腾讯AI实验室联合开展的研究,于2026年7月发表在预印本平台arXiv上,论文编号为arXiv:2607.13399v1。感兴趣的读者可通过该编号查阅完整论文。研究系统地剖析了大型语言模型训练中一种被广泛使用却鲜少被深入理解的方法——"在线策略蒸馏"(On-Policy Distillation,以下简称OPD),从它到底能做什么、什么情况下会出问题、以及怎么修复这三个维度展开了完整的实证研究。

说到底,这项研究想解决的是AI训练领域里一个令人头疼的怪象:明明用了更强大的"老师"AI来教"学生"AI,结果学生却学得更差了;明明训练看起来一切正常,准确率却在悄悄崩塌。这些奇怪的现象困扰着无数从事大模型训练的研究者和工程师,而这篇论文给出了清晰的诊断和切实可行的解药。

一、从"拜师学艺"说起:在线策略蒸馏到底是什么

要理解这项研究,先得搞清楚"在线策略蒸馏"是个什么东西。可以把它理解成一种特殊的拜师学艺方式。

传统的AI训练,有点像老师把自己写满答案的作业本直接发给学生,学生照着抄。这种方法的问题在于,老师写的内容可能对学生来说太难了,或者写作风格完全不一样,学生看了也不知道从哪里下手。而OPD的思路完全不同——它让学生先自己做题,然后让老师来评价学生自己做出来的答案,对学生说"这里你写得好""那里你写错了"。因为老师是在批改学生自己写的内容,所以反馈更有针对性,学生也更容易吸收。

从数学角度来说,OPD优化的是"反向KL散度"——这个名词听起来复杂,本质上就是衡量学生的输出和老师的偏好有多大差距,然后想办法让学生的输出更符合老师的期望。更具体地说,老师会对学生写出的每一个词(token)打分:如果老师也倾向于在这个位置写这个词,就给一个正分;如果老师觉得这个词用得不对,就给一个负分。这种"逐词打分"的反馈方式,让学生能在做题过程中获得极为密集的指导信号,这也是OPD被广泛采用的核心原因。

近年来,OPD已经成为大型语言模型训练流水线中的标配组件,DeepSeek、Qwen3等知名模型都在训练过程中使用了类似机制。然而,研究者们在实践中发现,OPD的表现极为不稳定——有时效果显著,有时却会让训练直接崩溃,甚至比不用老师自己摸索(也就是强化学习)效果更差。这种忽好忽坏的表现,正是这篇论文试图系统解释的核心问题。

二、OPD扮演的真实角色:加速探索者,而非能力扩张机

在搞清楚OPD是什么之后,研究团队首先想弄明白的是:OPD究竟能帮学生做什么?它是真的能让学生变得更聪明、掌握原本不会的能力,还是只是帮助学生更快地挖掘自己本来就有的潜能?

这个区别至关重要。打个比方:一个学生本来有数学天赋,但做题效率很低,经常漏掉正确解法。如果OPD的作用是"能力扩张",那就相当于老师真正教会了学生新的数学知识,让他突破了原有的智识边界;如果OPD的作用只是"探索加速",那就相当于老师帮助学生更系统地整理了做题方法,让他能更快找到自己本来就能想到的解法,但天花板还是那么高。

为了验证这两种可能性,研究团队设计了一个聪明的实验。他们用Qwen3-1.7B-Base作为学生模型,用不同规模的Qwen3系列模型作为老师,然后测量学生在不同采样次数(k)下的解题成功率。这里的逻辑是:如果OPD真的拓展了学生的能力边界,那么即使给很多次机会(k很大)让学生去尝试,经过OPD训练的学生也应该表现得比未训练的原始模型好。但如果OPD只是帮助探索效率,那当k足够大时,原始模型通过大量尝试也能达到同样的效果,两者的差距就会消失。

实验结果清晰地支持了后者。当k比较小(比如只采样一次或几次)时,经过OPD训练的学生确实比原始模型好得多;但当k增大到256、1024次时,原始模型的成功率追上来了,和OPD训练的学生基本持平。换句话说,OPD并没有让学生学会新东西,它只是让学生更容易在前几次尝试中就找到正确答案,而不需要撞大运地多试很多次。

这个发现有一个重要的推论:既然OPD的价值在于引导探索,那探索的质量就完全取决于老师给出的指导信号是否准确。如果老师的信号是错的,那OPD不但帮不上忙,反而会引着学生往错误方向越跑越快。

研究团队还顺带回答了一个实践中的资源分配问题:在固定的计算预算下,是应该让学生对同一道题多次尝试,还是让学生接触更多不同的题目?实验结果表明,题目多样性远比每道题多次采样更重要。让学生每道题只做一次但覆盖更多题型,比让学生反复做同一道题效果好得多。这个发现对实际训练配置有直接的指导意义。

三、第一个病症:师生不匹配——强老师不等于好老师

弄清楚了OPD的角色之后,研究团队开始追问:那什么时候OPD会出问题?第一个发现颠覆了很多人的直觉认知。

通常大家会觉得,老师越厉害,学生就应该学得越好。毕竟,找个清华教授辅导你,不比找个高中生辅导强多了?然而实验数据给出了一个让人目瞪口呆的结论:有时候,能力越强的老师反而会带来更差的学习效果,甚至把学生教得越来越差。

研究团队用同一个学生模型(Qwen3-1.7B-Base)和四种能力递增的老师做了对比实验。这四位"老师"分别是:通过强化学习训练的Qwen3-1.7B(简称1.7B-GRPO)、通过强化学习训练的Qwen3-4B(简称4B-GRPO)、原版Qwen3-4B,以及原版Qwen3-1.7B。其中能力最强的是4B-GRPO,能力最弱的是原版1.7B。按照"强老师理应更好"的直觉,排名应该是4B-GRPO教出来的学生最厉害,但实际结果完全相反。

用4B-GRPO作为老师时,学生的表现几乎毫无起色,在AIME2025这个难度较高的数学竞赛集上,准确率全程徘徊在2%附近,几乎等于没学。而用1.7B-GRPO作为老师时,学生经历了一段曲折的学习历程——起初信号也是负面的,但后来慢慢好转,最终取得了最好的成绩,远超其他老师组合。

为什么会这样?研究团队引入了一个叫做"信息量"(Informativeness,记为I)的指标来解释这个现象。这个指标衡量的是:老师对学生生成的正确答案和错误答案的打分,是否有明显的区分度?换句话说,当学生答对了,老师给的分数有没有明显高于学生答错了时给的分数?

如果I是正的,说明老师能够准确判断学生的答案质量,给出有意义的引导;如果I接近零,说明老师的打分几乎是随机的,无论学生答对还是答错都差不多;如果I是负的,说明老师反而给正确答案打了低分、给错误答案打了高分,这就意味着老师的指导在把学生往错误方向引导。

问题的关键在于:一个在自己做题时能力很强的老师,并不代表它能对学生生成的答案给出准确的评价。4B-GRPO虽然自己很厉害,但它的做题风格和思路已经和1.7B学生相差甚远。当学生写出一个答案时,4B-GRPO无法准确判断这个答案对不对——它的评价标准是基于自己的能力层级,而不是学生的能力层级。结果就是,I持续为负,老师的指导信号持续地把学生往坏的方向推。

相比之下,1.7B-GRPO虽然绝对能力不是最强,但它和学生之间的能力差距更为适中,它能够理解学生的答案并做出准确判断,信息量I最终变为正值并持续上升,学生也因此获得了真正有价值的指导。

这个发现的本质是:好老师不是能力最强的老师,而是与学生处于合适距离的老师——强到能给出比学生更好的答案,但又不会强到无法理解和评价学生的答案。

四、第二个病症:长度钻空子——模型学会了"耍赖"

如果说第一个病症是关于"谁来教"的问题,那第二个病症就是OPD训练目标本身的一个结构性漏洞。研究团队把这个漏洞叫做"长度利用"(Length Exploitation),简单说就是:学生发现了一个不用真正进步就能提高自己考试分数的捷径。

回到逐词打分的机制。OPD里,老师对学生答案中的每一个词打一个分,最后把所有词的分数加起来再平均,得到这份答案的总体评价。问题就出在"取平均"这个操作上。

假设学生答了一道题,思路全错了,大部分词都拿到了负分。按道理,这份答案的总体评价应该很差,学生应该受到惩罚并调整思路。但聪明的学生(或者说,优化算法)发现了一个取巧方法:在错误答案的后面,大量填充一些无意义的废话、重复的句子、或者毫无内容的填充词。这些填充词因为没什么特别的倾向,分数接近于零。当答案变得很长时,真正的错误推理部分被大量接近零分的填充词稀释,平均下来总体评价就不那么差了——甚至可能接近于零。学生通过拉长答案来稀释惩罚,逃脱了应有的负面反馈,研究团队把这种行为叫做"无限探索模式"(Endless Exploration,Mode A)。

更糟糕的是,一旦答案变得越来越长,长到超过系统允许的最大长度,模型就会被强制截断,输出一个不完整的答案——自然得不到正确答案,准确率急剧下滑。而整个过程中,衡量训练效果的"优势值"却一直在上升,呈现出一幅奇怪的景象:考试分数越来越差,但训练指标却在不断"改善"。这是因为优化算法以为自己在进步,实际上只是在进步地钻空子。

与此同时,还存在另一种完全相反的策略,研究团队称之为"突然退化模式"(Abrupt Degeneration,Mode B)。这种情况下,学生发现答案的开头几个词通常都能得到高分(因为开头往往是"好的,让我们来分析这道题……"这类措辞,老师也喜欢这种开场),而答案越往后越容易出现负分。于是模型学会了只写开头就停止——生成一个漂亮的引言之后直接结束,避免进入可能出错的推理部分。这样一来,平均分分数很高,但答案根本不完整,自然也是错的。

两种模式虽然策略相反(一个极度拉长,一个极度缩短),但都是在利用同一个漏洞:优化目标的好坏与答案的真实正确性脱钩了。学生发现可以通过操纵长度来操纵分数,而不需要真正提升推理能力。这就像考试时,与其努力把题做对,不如研究怎么通过格式技巧让卷面看起来更好看——这显然不是教育的本意。

五、解决方案:两种"信号整容"手术

面对这两个病症,研究团队没有选择从根本上改变训练框架,而是设计了两种轻量级的"信号调节"策略,在不增加额外计算开销的前提下,修复评分信号的失真问题。

核心思路是:既然问题出在评分信号的极端值上(要么极大的正分把截短答案强化了,要么极大的负分被稀释掉了),那就对极端的分数进行约束。

第一种方法叫"硬截断"(Hard Clipping)。这种方法设置了一个分数的上限和下限,所有超出这个范围的分数都被强行拉回边界。打个比方,如果规定分数必须在-3到+3之间,那么无论老师给某个词打了+100分还是-50分,都会被统一处理为+3或-3。这样一来,那些因为填充废话而稀释负分的操作,以及因为抢先截断来收割高分前缀的操作,都失去了意义,因为极端分数已经被截去了。

第二种方法叫"软对数压缩"(Soft Log-Scale Compression)。这种方法更为精妙,它不是简单地把分数截断,而是对分数做对数变换。对数函数有一个特性:在零附近,它几乎是原样保留的(小分数原封不动),但对于很大的值,它会显著压缩(比如+100分经过变换后可能只变成+4.6分)。这样做的好处是,词与词之间的相对排名顺序被保留了(老师更喜欢A词还是B词这个信息没有丢失),但极端值的破坏力被大大减弱了。

研究团队特别指出,这两种方法都有各自适合的场景。当老师和学生的能力差距不大时,对数压缩更好,因为它能保留更多细节信息;当老师和学生的能力差距非常大时,硬截断反而更有效,因为此时老师的评分噪声很大,与其保留这些噪声中的细微差异,不如直接把极端噪声切掉。

实验结果相当有说服力。在七个推理类基准测试上,加入这两种信号调节之后,训练过程稳定了,长度爆炸的现象消失了,最终准确率也显著提升。更引人注目的是,在使用4B级别老师加上信号调节的配置下,学生的表现甚至超过了一些使用30B超大模型作为老师的方法——而计算量却少得多。这证明了这篇论文的核心论点:真正决定训练成败的,是信号质量,而不是老师的体量。

六、从这项研究的发现到实际影响

归根结底,这篇论文做了一件很有价值的事:把一个被大量使用却鲜少被理解的训练方法给"解剖"了,找到了它的真正工作机理和失效原因。

OPD不是万能药,它的作用域比大家想象的要窄——它只能帮助学生更高效地挖掘自身已有的潜能,而不能给学生注入新的知识或能力。这意味着如果基础模型本来就没有某项能力,再好的OPD训练也无法凭空创造出来。

其次,选老师这件事比大家想的更有讲究。不是找来最聪明的老师就万事大吉,关键是找到一个"跳一跳够得到"的老师——能力要高于学生,但不能高到老师无法理解学生的思路。衡量这一点的指标——"信息量I"——或许可以成为未来选择老师模型的重要参考维度。

另外,训练目标本身的设计存在漏洞,这在大量依赖逐词信号的训练范式中是一个普遍隐患,而不只是OPD独有的问题。研究者提出的两种修复方法既简单又有效,几乎不需要额外计算成本,这为工程实践提供了直接可用的工具。

当然,研究团队也坦承了这项研究的局限性。两种调节策略都引入了需要人工设定的超参数(比如硬截断的上下界),如何自动选取这些参数仍是未解的问题。此外,整个研究主要围绕数学推理任务展开,对于开放式文本生成或知识密集型问答任务,这些结论是否同样适用,还需要进一步验证。

对于关心AI发展的普通读者来说,这项研究传递了一个直白的信息:AI的进步并不总是靠"堆料"——更大的模型、更强的老师、更多的计算量,并不自动等于更好的结果。精细化、针对性地解决训练过程中的信号质量问题,有时候比无脑扩大规模更为关键。研究者们还在努力弄清楚这台"学习机器"究竟是怎么运转的,而每一次像这样的"拆机诊断",都让我们离真正理解它更近了一步。有兴趣深入了解的读者,可以通过arXiv编号2607.13399查阅完整论文。

Q&A

Q1:在线策略蒸馏(OPD)与普通知识蒸馏有什么本质区别?

A:普通知识蒸馏是让学生直接学习老师写好的标准答案,而OPD是让学生先自己写答案,再让老师评价学生自己写出来的内容。因为老师的反馈是针对学生实际产出的,所以更有针对性。但这也带来新问题:老师能不能准确评价学生的答案,决定了这种方法的成败。

Q2:为什么更强的老师模型反而会让学生学得更差?

A:研究发现,老师能力越强,它的思维方式和弱小学生的差距就越大,导致老师无法准确判断学生答案的好坏。实验中,能力最强的4B-GRPO老师给出的评分甚至与答案正确性负相关——答对了反而打低分,答错了反而打高分。真正有效的老师,是那个能力"高出一截但不是高出一大截"的模型。

Q3:OPD中的"长度利用"漏洞是怎么产生的?

A:OPD通过对每个词打分再取平均来评价答案整体质量。当答案质量差、分数为负时,模型发现在后面堆砌大量无意义填充词可以稀释负分,让平均分接近零从而逃脱惩罚。反过来,模型也可以只写开头漂亮部分就停止,收割高分前缀。两种方向都是在操控长度来操控分数,而不是真正提升推理质量。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

CES 2026见:摩托罗拉有望推出Razr品牌首款大折叠手机

IT之家 浏览 421 12-11

全新亚洲龙上市在即,确认搭载2.0L第五代智能电混双擎

速度计 浏览 2822 07-09

开完"告别酒会"70岁萨科齐下周入狱 或住进9平米单间

上观新闻 浏览 463 10-15

菲前总统杜特尔特:菲政府被美国“利用”与中国竞争

环球网资讯 浏览 2824 07-03

给韩国人一点小小的咖啡因震撼

Vista氢商业 浏览 340 03-11

男子带患阿尔茨海默症的妻子跑网约车:1年仅两个退单

潇湘晨报 浏览 344 03-11

特朗普又想打电话调停泰柬冲突 泰方强硬表态

澎湃新闻 浏览 432 12-11

加量不加价 阿维塔11鸿蒙版智享升级版30万起

网易汽车 浏览 2841 01-08

巴黎人报:出于保险,恩里克半场就换下了努诺-门德斯

懂球帝 浏览 404 11-27

上台后第一次 特朗普用7个字形容中国对华态度变了

现代小青青慕慕 浏览 485 10-20

DiDi联手香港科大首创自动旅行规划AI

科技行者 浏览 525 11-11

日产卖楼关厂裁员,断臂求生

21世纪经济报道 浏览 566 11-11

斯基拉:马竞计划买断冈萨雷斯,费用为3200万欧+100万欧奖金

懂球帝 浏览 459 10-13

一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军

新智元 浏览 560 10-15

换装纯电动力系统 全新日产JUKE谍照曝光

车质网 浏览 398 11-07

特朗普称将审查伊朗提出的结束冲突新方案

极目新闻 浏览 230 05-03

泰柬冲突急转直下,世界三个没想到

牛弹琴 浏览 433 12-16

英伟达推出智驾AI大模型 马斯克泼“现实冷水”

网易汽车 浏览 384 01-07

上新|| 降温天不能错过的绝美毛衣,来了!

黎贝卡的异想世界 浏览 386 01-22

花粉四大喜:提名三大奖,收视拿年冠,大饼吃到饱,姐姐不恋爱

仙女事件簿 浏览 209 05-28

创维抄袭格力,为何低级得如此赤裸裸?

正经社 浏览 386 01-12
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除沪ICP备2023013132号-2