关闭广告

让AI的"隐形思维"也能越练越强,这项突破或将重写推理效率的边界

科技行者2026-08-05 00:00:010人阅读


这项由香港理工大学与四川大学联合开展的研究,以预印本形式发布于2026年7月22日,论文编号为arXiv:2607.19691v1,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

当你解一道数学题,脑袋里会经历一段"内心独白"——先想到用哪个公式,再试试代入数字,发现不对就回头重想。这个过程虽然在纸上看不见,却是你真正在"思考"的核心环节。现在,让AI也拥有这种"内心独白",正是近年来人工智能研究的一个重要方向,学界把它叫做"潜在推理"(Latent Reasoning)。

然而,这条路走到今天却遇到了一堵墙:AI的"内心独白"虽然速度更快、计算量更少,却一直被关在"模仿"的笼子里,没办法像那些把思维过程写出来的AI一样,通过"做对了就奖励、做错了就惩罚"的强化学习方式来自我提升。这就好比一个学生能在脑子里飞速运算,却始终只能靠抄老师的解题步骤来学习,而没办法通过自己做对题目获得成就感从而越练越强。

来自香港理工大学和四川大学的研究团队,正是要打破这堵墙。他们提出了一套叫做**SLPO(Surrogate Latent Policy Optimization,代理潜在策略优化)**的新方法,让AI的"隐形思维"也能接受结果导向的强化训练,从而真正实现"越难的题目想得越久,越简单的题目早点收手"的智能计算分配。

一、AI的两种"思考方式":说出来的和藏在心里的

要理解这项研究的意义,得先搞清楚AI目前有哪两种主要的推理方式,以及它们各自的优缺点。

第一种叫做"显式思维链"(Chain-of-Thought,简称CoT)。这类AI在回答问题之前,会像学生演草稿一样,一步一步把推理过程用文字写出来。比如回答"小明有3个苹果,给了小红1个,还剩几个?",AI会先写"3减1等于2",再给出答案"2个"。这样做的好处是每一步都有迹可循,AI也可以通过检查每个步骤的对错来学习和进步。近年来大火的DeepSeek-R1等推理模型,正是沿着这条路走出来的。

但这种方式有个根本缺陷:写出来的每一个字,都要消耗计算资源。更尴尬的是,很多写出来的文字其实是在凑语言逻辑的连贯性,而不是真正在推进解题过程——就像有人做数学题时会在草稿纸上写"首先我们知道……"这种废话一样。题目越难、推理越长,这种浪费就越严重。

第二种叫做"潜在推理"(Latent Reasoning)。这类AI不把中间步骤写成文字,而是把它们压缩成连续的数学向量,在模型内部的"隐空间"里悄悄流转,最后直接蹦出答案。好处显而易见:省掉了大量语言组织的开销,同样的算力能处理更多的实质性推理步骤。已有研究表明,潜在推理模型在很多标准测试上能以更短的中间计算量媲美甚至超越显式思维链模型。

然而,潜在推理有一个至今未被解决的硬伤:它的中间步骤是一堆数字向量,根本没有"这一步我选择了什么"的概率信息。而强化学习要奖惩AI,就必须知道"AI在这一步做出了什么决定、这个决定的可能性有多大"。没有这个概率信息,奖惩就无从下手。更何况,现有的潜在推理模型还有另一个问题:它们在训练和推理时都预设了固定的思考步数,不管题目是简单还是复杂,都想同样多步。这就好比无论你去便利店买瓶水还是去超市采购一周的粮食,都只给你同样长的购物时间,显然不合理。

正是这两道障碍——缺乏可用于强化学习的概率估计,以及固定不变的思考时长——让潜在推理始终停在"模仿老师解题"的阶段,无法像显式推理那样通过"做对了就自我强化"的方式越练越强。

二、两道障碍的拆解:SLPO的核心设计思路

研究团队把解决这两个问题的方案分成了两个相互配合的模块,共同构成了SLPO的骨架。

**第一个模块:用"代理密度"给隐形步骤打分**

要让强化学习发挥作用,必须能够评估"AI在每一步的选择有多靠谱"。对于显式推理,这件事很自然:AI每输出一个词,都有一个词汇表概率,直接拿来用就行。但对于潜在推理,中间步骤是连续的向量,不经过词汇表,也就没有现成的概率。

研究团队采用的思路,类似于一个质检员想评估一条流水线的产品质量,但无法直接检测每个零件,于是他多次重复运行这条流水线,观察同一个位置每次产出的零件有多大差异,以此推断这个位置的"稳定性分布"。具体来说,在训练过程中,对于潜在推理的每一个步骤,研究团队会用不同的随机扰动(技术上叫做"MC-Dropout",即蒙特卡洛随机丢弃)多次运行模型,得到若干个略有差异的输出向量。然后,他们用这些输出的均值和方差,拟合出一个高斯分布(一种常见的钟形概率分布)作为"代理"。

这个代理分布并不是对真实采样过程的精确描述,但它能给出一个合理的数值:当前步骤产出的这个向量,在这个代理分布下有多大的可能性出现。这个数值,就充当了强化学习所需要的"每步概率"。于是,奖惩信号便能通过这个代理概率,传递给整条推理链,让AI学会哪些思考路径更有可能导向正确答案。值得注意的是,被评估的那些中间步骤向量本身是固定的,不参与梯度传播;真正被训练更新的是模型在当前参数下重新计算代理分布的那个过程,这样既保证了训练的稳定性,又让奖励信号能有效传入模型。

**第二个模块:用"停止门"让模型自己决定想多久**

解决了概率问题之后,还有一个问题没解决:模型仍然不知道什么时候该停止思考。现有的潜在推理模型都是固定步数的,比如思考六步就停。SLPO的设计是给模型加装一个"停止门"——一个小型的神经网络模块,接在每一步潜在状态之后,输出一个0到1之间的概率值,表示"现在停下来解题"的把握有多大。

但这个停止门刚加上去的时候是空白的,不知道什么时候该停。于是研究团队设计了一个叫做"冷启动"的预训练阶段。做法是:对于训练集里的每道题,让模型用随机扰动的方式生成多条推理路径,然后在每条路径的每个候选长度处截断,解码出答案,和标准答案对比是否正确。这样就得到了一份"哪些长度能答对这道题"的清单。然后用这份清单来训练停止门:让它学会把停下来的概率集中到那些"截到这里就能答对"的步数上。

这个过程就像培训一个新员工,先告诉他"在这道题上,你在第4步停下来能答对,在第2步停下来就答错了",让他积累初步的判断经验,再上岗参加正式的强化训练。

三、将两个模块拼合成一个完整的训练目标

有了代理概率和停止门之后,SLPO就能构建出一个完整的训练目标,把三件事的得分加在一起:第一,潜在推理每一步的代理对数概率;第二,最终答案每一个词的生成概率;第三,在哪一步停下来的概率。把这三部分相加,就得到了整条推理路径的总得分。

在强化学习中,当一条推理路径最终产生正确答案时,这条路径的总得分就乘以一个正向优势值(大意是"比平均水平好多少"),通过梯度更新让这条路径在未来被更频繁地选择;当推理路径导向错误答案时,则施以相反方向的压力。这个优势值的计算,支持多种主流的强化学习算法,研究团队主要测试了RLOO(留一法基线)和GRPO(组相对策略优化)两种。

推理阶段则更为简洁:模型按步骤进行潜在思考,每走一步就让停止门评估一下,一旦停止概率超过预设阈值,就立刻解码答案,不再继续思考。阈值通过在验证集上扫描不同候选值(0.5、0.6、0.7、0.8、0.9)来选定,选出验证准确率最高的那个。

四、实验设置:在哪里、用什么、和谁比

研究团队在数学推理任务上对SLPO进行了系统测试,这是目前潜在推理领域最常用的标准评估场景。训练数据使用GSM8K-Aug,这是基础数学应用题数据集GSM8K的一个扩充版本。评估则在三个测试集上进行:GSM8K官方测试集、GSM-Hard(把GSM8K里的数字换成更大的量级,让题目更难)、以及MultiArith(多步骤算术题集合)。在另一组软令牌迁移实验中,还额外评估了MATH500、AIME 2025和AMC23这三个难度更高的数学测试集。

测试对象包括两个不同规模的语言模型骨架:GPT-2(约1.24亿参数,相对较小)和Llama-3.2-1B-Instruct(约10亿参数,相对较大)。SLPO被施加到两个已有的潜在推理基础模型上:COCONUT(通过课程压缩学会潜在推理)和CODI(通过自蒸馏将显式思维链压缩为连续表示)。对比的基线方法覆盖了多种路线:显式推理的CoT-SFT和iCoT、以及一批现有潜在推理方法包括CoLaR、ReGuLaR、DART和Latent-SFT。

评估指标方面,研究团队采用了两类:Acc(确定性准确率,关闭随机扰动,用单次确定性推理的结果)和Pass@k(并行采样准确率,用k次随机推理路径,只要有一次答对就算成功)。Pass@k中的k取8和16,通过MC-Dropout(随机丢弃率0.1)产生随机性。此外还记录了平均推理步数(#L)。

整个训练流程分两阶段:先用停止门冷启动训练15个轮次,再用SLPO主体进行最多40000步的强化优化。训练使用4块RTX 5880 Ada显卡,每块GPU批量大小16,合计有效批量64。学习率设为极低的1e-6,配合2000步热身的常数学习率调度。值得一提的是,训练中没有加入KL散度惩罚(用于防止模型偏离初始状态太远的常见保险措施),研究团队选择了更激进的纯结果导向优化。

五、主要实验结果:SLPO让两个基础模型都变得更强

在最核心的对比实验中,SLPO分别应用于COCONUT和CODI,并在GPT-2和Llama-3.2-1B两种骨架下进行测试。

加持SLPO之后,无论是COCONUT还是CODI,在GPT-2和Llama两个规模上,准确率和Pass@k指标都有所提升。规律颇为清晰:Pass@16的提升幅度普遍大于Pass@8,而Pass@8又大于单次确定性准确率的提升。这个规律很有意思——它说明SLPO优化出来的模型,在随机探索多条路径时的覆盖能力提升更为显著,这正是强化学习塑造了一个更好的随机策略的体现。换句话说,模型不仅能偶尔答对,而且在多次尝试时更稳定地找到正确路径。

具体数字上,以Llama骨架为例,COCONUT+SLPO在GSM8K上的Pass@16从38.13升至41.85,在MultiArith上从63.10升至71.38;CODI+SLPO在GSM8K上的Pass@16从67.48升至70.28,在MultiArith上从98.79升至99.48。提升幅度在COCONUT这个相对较弱的基础模型上更为明显,而在CODI这个已经较强的基础模型上提升幅度则相对温和但仍然持续存在。

在与更广泛基线的对比中,CODI+SLPO在Llama骨架下的GSM8K准确率(55.27%)略高于显式CoT-SFT(54.1%),同时使用的平均推理步数(6.30步)远少于CoT-SFT(25.4步)。这意味着:用更少的中间步骤,达到了相当甚至略好的准确率。CoLaR、ReGuLaR、DART、Latent-SFT等同类方法在部分子任务上有竞争力,但SLPO作为一个可以直接插在已有潜在推理模型上的方法,具有更强的灵活性。

六、停止门学会了什么:难题多想一会儿,简单题早点收手

SLPO最引人注目的现象之一,是停止门在优化之后展现出了"按难度分配计算量"的行为。研究团队用"1减去Pass@32准确率"来衡量题目难度——一道题越难,在32次随机尝试中答对的比例越低,难度值就越高。

把所有测试题按难度分成10个区间,再统计每个区间的平均潜在思考步数,可以清楚看到:难度区间越高,平均步数越长。最难的那组题,平均要想6步以上;最简单的那组题,平均不到5.2步就停了。两者相关系数在验证集上为0.30,在测试集上为0.26,显示出稳健的正向关联。

这个结果意义非凡。它说明,在SLPO的训练之后,停止门没有退化成"永远在第3步停"或"永远想满6步"的极端策略,而是真正学会了根据输入问题的实际难度,灵活分配思考时长。这正是"自适应计算"的核心价值——计算资源不再被平均分配,而是向真正需要它的地方倾斜。

七、两种强化算法都管用:SLPO不绑定特定算法

SLPO的设计目标之一是作为一个通用框架,能与不同的强化学习算法配合使用。研究团队在RLOO和GRPO两种主流算法下分别测试了SLPO的效果。结果显示,两种算法在各测试集和不同的k值下表现非常接近,没有哪一种在全部情况下都占优势。在COCONUT骨架上,RLOO在Pass@1和Pass@8上略胜,GRPO在Pass@16上紧随其后;在CODI骨架上,GRPO在GSM-Hard的Pass@1和Pass@8上略占优,RLOO在MultiArith和GSM8K上稍有优势。

这种高度相似的表现本身就是一种有价值的信号:它说明SLPO提供的代理概率足够合理,让不同的优化算法都能从中稳定地提取学习信号。换句话说,SLPO的瓶颈不在于选哪种强化算法,而在于代理概率本身的质量。这为后续研究留下了清晰的优化方向。

八、迁移到另一种潜在推理方式:软令牌推理

SLPO的设计并不局限于某一种特定的潜在推理架构。研究团队进一步将其应用到"软令牌推理"(Soft Latent Inference)这一不同的机制上。软令牌推理的工作方式不同于前面讨论的隐状态传递:它在每个潜在步骤中,把模型对词汇表的概率分布乘以词向量矩阵,得到一个加权平均的嵌入向量,再把这个嵌入向量送入下一步。这相当于模型在每一步"模糊地想着所有可能的词",而不是硬性选定一个词。

把SLPO应用到这种机制时,代理概率的计算方式保持不变,只是把评估对象从隐状态向量换成了这个加权嵌入向量。在Llama-3.2-1B上,SLPO在GSM8K和MATH500上均优于对比方法(包括CoT基线、GRPO直接优化、以及专门为软令牌设计的LEPO方法)。在Llama-3.2-3B上,对于极难的AIME 2025测试集,SLPO的Pass@1达到3.33%,而最强竞争者LEPO为0.96%,CoT类方法普遍在0.42%~0.83%之间;AMC23的Pass@1也从LEPO的27.03%进一步提升到32.50%。

特别有意思的是一张追踪训练过程中平均输出序列长度的图:在软令牌推理下用SLPO训练时,模型生成的序列平均长度随着训练步数稳步增长,从约750个词扩展到超过1000个词;而同样设置下用GRPO或LEPO训练的模型,序列长度则基本维持在初始水平附近甚至略有收缩。这说明SLPO真正触发了模型的"多想一点"行为——模型自发地学会了为了更好的结果而延长推理过程,而不是被动地接受固定长度限制。

九、潜在空间的几何变化:训练后AI的"内心世界"发生了什么

强化学习在外部行为(准确率提升)上的效果已经测量清楚了,但研究团队还想知道:SLPO在AI的"内心世界"里究竟改变了什么?他们从两个几何角度分析了训练前后潜在推理状态的变化。

第一个角度叫"步间余弦距离"(Inter-step Cosine Distance),测量的是相邻两个潜在步骤的向量之间有多大差异。余弦距离为0意味着两个向量方向完全一样,为1意味着完全垂直。如果步间距离大,说明每一步思考都在向不同方向迈进,整个推理过程有清晰的"阶段感";如果步间距离小,说明每一步都差不多,思考在原地打转。SLPO之后,这个距离在所有测试集和骨架组合上都有所增加,GSM-Hard上的增幅最大(GPT-2骨架增加17.1%,Llama骨架增加17.8%),SVAMP和MultiArith上的增幅相对温和(3.8%到7.2%之间)。整体来看,SLPO让相邻步骤之间的差异变大了——每一步思考都在推动状态向新的方向移动。

第二个角度叫"前缀有效秩"(Prefix Effective Rank),测量的是随着推理步骤的积累,所有步骤向量共同张开的独立方向有多少。如果有效秩高,说明每一步都在探索新的方向,推理路径覆盖了潜在空间的多个维度;如果有效秩低,说明所有步骤都集中在少数几个方向上,思考更加专注和聚焦。SLPO之后,有效秩在所有骨架、数据集和基础模型组合下都有所下降——虽然下降幅度因组合而异,但方向一致。这意味着SLPO让潜在推理轨迹变得更加集中,不再漫无边际地探索潜在空间,而是沿着更聚焦的子空间前进。

把这两个发现合在一起,可以得出一幅有趣的图景:SLPO之后的潜在推理,每一步相邻状态之间的差异更大了(更有阶段感),但整体轨迹覆盖的独立方向却更少了(更加聚焦)。就好像一个人解题时,每一步思维跳跃都更大,但跳跃的方向更集中、更有目的性,而不是四面开花地乱想。

十、对K和G两个超参数的敏感性:组大小比采样次数更重要

SLPO有两个关键的超参数需要调节:K和G。K是计算每步代理概率时,用多少次独立的随机扰动来估算均值和方差(相当于用多少次重复试验来测量流水线的波动);G是每道题采样多少条完整推理路径来计算强化学习的优势值(相当于一次比赛里有多少名选手,选手越多,"平均水平"估算得越准确)。

扫描K和G各自取2、4、8的结果表明,G对最终性能的影响更为显著——G从2增加到8时,Pass@2在GSM-Hard和MultiArith上都有明显且稳定的提升。K的影响则相对较小:只要K达到一个最低阈值(大约4次就够),继续增加K带来的额外收益有限,而且依赖于具体数据集。这个规律有直观的解释:G越大,优势值的估算越准,强化学习的更新方向越可靠;而K只要足够稳定化代理概率的估算即可,过多的重复采样只是浪费计算,不能根本性地提升学习效果。在最终实验中,研究团队选用了K=4和G=8作为默认配置。

说到底,这项研究做的事情可以用一句话概括:它给AI的"沉默的思考"装上了一个可以被奖惩的接口,还配备了一个懂得"难题多想一会儿"的停止开关。

这两件事看起来细节,但对于整个潜在推理领域的走向却有实质性的影响。此前,潜在推理的研究者面对一个尴尬局面:他们知道潜在推理比显式推理更高效,却没有办法让它像显式推理那样通过做对题目来自我改进。SLPO打通了这条通路,不需要改动底层的推理架构,只需要加上一个停止门,再用代理概率替换缺失的步骤概率,就能把现有的强化学习工具直接用上。

当然,这项工作也有局限。目前的实验主要集中在数学推理任务上,模型规模最大只到10亿参数级别。更大的模型、更开放的任务(比如写作、编程、多模态理解),以及代理概率估算是否足够精确等问题,都有待后续研究回答。研究团队在论文中也明确指出,未来希望将SLPO扩展到更大的骨架、开放式推理任务和多模态潜在架构上。

如果你对AI如何思考这件事感兴趣,不妨追问一下:当AI能够真正决定"我需要想多久"时,它的决策依据是什么?是题目的表面难度,还是它在推理过程中察觉到的某种内在复杂性?这或许是理解AI推理机制的下一个有趣问题。有兴趣深入了解的读者,可以通过arXiv编号2607.19691查阅完整论文。

Q&A

Q1:SLPO中的"代理概率"是什么意思,为什么潜在推理需要它?

A:潜在推理的中间步骤是向量数字,没有"选了哪个词"的概率,而强化学习必须依赖这种概率才能进行奖惩训练。SLPO的解决方案是:用多次随机扰动运行模型,观察同一步骤的输出如何波动,再用这些波动拟合出一个近似的概率分布,称为"代理概率"。它不是精确的真实概率,但足以让强化学习信号顺利传递给模型进行更新。

Q2:SLPO的停止门是怎么学会判断题目难度的?

A:在停止门的"冷启动"阶段,模型会对每道训练题在不同的思考步数处截断并解码答案,记录哪些步数能答对。停止门随后被训练成把"停下来"的概率集中分配给那些能答对的步数位置。经过SLPO强化训练之后,这个判断进一步精细化,使得较难的题目触发更晚停止,较简单的题目更早收手,从而实现计算资源的自适应分配。

Q3:SLPO和现有的显式思维链强化学习方法(如GRPO、RLOO)有什么本质区别?

A:现有显式推理的强化学习方法直接利用每个生成词的词汇表概率,这个概率是现成的。SLPO面对的是没有词汇表概率的连续向量推理,所以它额外引入了代理概率估算机制来补全这一缺失环节。在代理概率建立之后,SLPO可以直接套用GRPO或RLOO等现有算法,并不需要发明新的优化算法,而是专注于填补潜在推理与强化学习之间的接口空白。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT4o

量子位 浏览 567 10-14

吉利品牌登陆英国市场,目标 2030 年实现 10 万台汽车销量

IT之家 浏览 581 10-27

伊朗总统:战争既不符合伊朗也不符合美国利益

国际在线 浏览 373 02-01

美国步步攫取委内瑞拉石油利益:主权在委 财权在美

澎湃新闻 浏览 451 02-05

马斯克承认其他车企不想获得特斯拉FSD授权:他们简直疯了

IT之家 浏览 601 11-25

丰田的反射弧有点长,但终于明白过来了

观察者网 浏览 19774 07-03

可折叠iPhone来了却可能买不到?分析师预警发布初期将严重缺货

环球网资讯 浏览 464 12-21

每体:拉菲尼亚伤势恢复不如预期,出战国家德比存疑

懂球帝 浏览 475 10-15

杨幂六一儿童节为10岁女儿送生日祝福,喊小糯米“我闺女”好亲昵

娱絮 浏览 2834 06-03

大6座/插混/长续航 五菱星光L预售权益价11.78万起

网易汽车 浏览 213 05-28

普京:美版和平方案与普特会讨论一致

新华社 浏览 425 11-25

“勃肯鞋”今年冬天爆火!这几双怎么搭都好看

LinkFashion 浏览 398 12-29

凌晨4点,超3万人现场观看!太火爆……

环球网资讯 浏览 416 01-18

A股进入“两会”时间,16大热门投资赛道出炉

览富财经网 浏览 395 03-03

三亚五星酒店再现10万房价 有人1折买3件奢侈品花1250

时代财经 浏览 436 01-02

21载热血传承!2025肯德基三人篮球赛燃动青春赛场

中国商报 浏览 410 12-21

两家社保抱团重仓4500万股,养老金买了400万股,年利润20亿

资本百科 浏览 2891 02-19

“网红”雷军,还会有2.0版吗?

酷玩实验室 浏览 16669 06-03

生涯之夜!邹阳35+7三分创新高 福建大胜送四川开局9战全败

醉卧浮生 浏览 393 01-02

罗体:尤文图斯有意赫罗纳队巴西边锋萨维奥

懂球帝 浏览 2759 06-03

陈妍希带娃现身海口,儿子小星星近状曝光,母子俩牵手同行好温馨

扒虾侃娱 浏览 441 12-21
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除沪ICP备2023013132号-2