关闭广告

Mistral AI用8B视觉语言模型刷新导航天花板

科技行者2026-08-05 00:00:011人阅读


这项由Mistral AI研究团队主导完成的研究,以预印本形式发布于2026年7月22日,论文编号为arXiv:2607.20785,感兴趣的读者可通过该编号在arXiv平台查阅完整论文。

**机器人的眼睛,是一件奢侈品吗?**

假设你被蒙上眼睛,只能靠一只眼睛睁开后看到的画面来找路——没有地图,没有激光雷达扫描,没有测距仪,只是一帧一帧的普通照片。这正是绝大多数家用机器人、仓库小车、送货无人机面临的现实处境:传感器越多越精准,成本就越高,适用范围也越窄。今天要介绍的这项研究,正是奔着打破这道门槛而去的。

Mistral AI的工程师和研究人员构建了一个名为**Robostral Navigate**的导航系统,其核心是一个拥有80亿参数的视觉语言模型(可以简单理解为一个既能"看图"又能"读文字指令"的超大脑)。这个系统只需要一个普通的RGB摄像头——就是你手机前置摄像头那种最平常的彩色镜头——然后根据自然语言指令,比如"穿过前面那扇门,在橙色沙发前右转",自主规划并走完整段路程。

在学术界的标准测试场上,Robostral Navigate以77.4%的任务成功率登顶Room-to-Room连续环境基准(R2R-CE),比此前最好的单摄像头方案高出整整10.5个百分点,甚至比那些配备了深度传感器或多摄像头阵列的系统还高出5.3个百分点。这个结果放在机器人导航领域,犹如一个只带了一支铅笔的选手,在一群带着全套绘图工具的对手面前赢得了绘图大赛。

一、为什么"只用一只眼睛"是一件难事,又是一件值得做的事?

现代机器人导航领域有一个共识:传感器越多越好。深度摄像头可以直接测量物体距离,激光雷达可以扫出精确的三维地图,多摄像头组合可以覆盖更大视野,这些都能让机器人对周围环境的理解更加立体和精准。但代价是:每一种额外传感器都意味着更高的硬件成本、更复杂的安装调试,以及只能在特定机器平台上使用的局限性。一套为配备激光雷达的机器人训练出来的导航模型,往往没办法直接用在一辆只有普通摄像头的配送小车上。

Mistral AI的研究者把这个问题称为"可扩展性困境"——如果你的导航系统对传感器要求越高,它能落地的场景就越少,最终只能服务于少数几个高端机器人平台。他们想要的是另一种路径:找到一套既省传感器、又能跨平台、还能高效训练的导航方案。

普通的RGB摄像头是几乎所有机器人平台都标配的最基本传感器,从工厂里的搬运小车到家用扫地机器人,从无人机到人形机器人,几乎没有哪台机器不带一个彩色摄像头。如果一套导航算法能在这个最低配置下工作,那它就可以几乎无缝地迁移到任意机器人上,真正实现"一套大脑,万台机器"的愿景。

然而,去掉深度传感器之后,机器人就失去了直接感知距离的能力。它只能从二维图像里推断哪里能走、目标有多远、转弯的时机在哪里。这就好比你只能靠一张普通照片判断前方的楼梯有多高、走廊有多长——人类靠后天积累的大量视觉经验可以做到,机器要学会这件事却需要极其丰富的训练数据和足够强大的视觉推理能力。Robostral Navigate的核心贡献,正是在这两个维度上同时取得了突破。

二、导航靠"用手指指"——一个听起来简单却极为聪明的设计

Robostral Navigate导航的核心机制,用一句话描述就是:**在当前看到的画面里,用像素坐标指出"下一步该往哪走"**。

研究团队把这种方式叫做"指向式导航"(pointing)。每当机器人需要决定下一步动作时,模型会看着当前摄像头画面,然后标出图像中的一个点——那个点就是"往这个方向走"的目标位置,同时还会预测到达那里时应该转向多少度。这就像你在带别人找路时,不是说"向前走23.5米再左转90度",而是直接伸手指着前方的一扇门说"往那里走"。

这个看似简单的设计,蕴含着一个很关键的优势:**图像坐标与摄像头的物理规格无关**。不管摄像头装在离地0.4米的矮小机器人上,还是装在1.8米高的人形机器人上,不管焦距是多少、画面比例如何,"图像里左数200像素、上数300像素"这个描述方式始终成立,不需要知道摄像头的具体参数。相比之下,如果改用"向前移动1.2米"这样的指令,那就必须知道机器人的确切尺寸和当前位置,换一台机器人就得重新校准。

当然,现实中总有"指不到"的情况。当目标位置不在摄像头视野范围内时——比如需要先原地转180度,目标才会出现在画面里——"指向"就用不上了。这时系统会切换到备用的"位移模式",直接给出相对于当前位置的平移距离和旋转角度(Δx、Δy、Δθ)。在实际训练数据里,大约只有10%的情况属于目标不可见,所以位移模式更多是作为补充手段存在,核心仍然是指向。当机器人判断任务完成时,系统还会输出一个特殊的"停止"指令。

这套预测体系里,模型在目标可见时同时输出五个量:图像坐标(u, v)、平移位移(Δx, Δy)和转向角Δθ;目标不可见时只输出后三个量。把位移预测作为共同训练任务,也有助于模型在不同场景下保持对空间关系的一致理解。

三、从预测"指哪里"到真正"走过去"——三层系统的接力

光是知道"往图像里那个点走"还不够,机器人的电机需要具体的转速指令,而不是像素坐标。Robostral Navigate把整个导航过程分成了三个层级,各司其职、串联运行。

最顶层是那个80亿参数的视觉语言模型本身,负责"看懂指令、看懂环境、决定方向",每0.5秒更新一次决策。它的输出就是前面说的指向坐标或位移量。

中间层是一个1.21亿参数的扩散策略模型(diffusion policy,可以理解为一个专门负责把方向感转化为具体步伐的小脑)。它接收大模型给出的路点、当前帧和参考帧,然后输出接下来1秒内的30个动作步骤——每个步骤是机器人底盘的相对位移和转角。这一层以每秒10次的频率运行,比大模型快20倍,保证运动足够平滑。

最底层是一个平台专属的运动追踪控制器,把中间层输出的轨迹进一步转化为每秒100次的电机指令,驱动机器人实际移动。这一层因机器人型号不同而有所差异,是整个系统里唯一需要针对不同平台定制的部分。

三层结构的分工逻辑类似于人开车:大脑(大模型)负责看地图决定走哪条路,身体(扩散策略)负责踩油门和转方向盘的具体幅度,汽车的电子系统(底层控制器)负责把方向盘角度转换成轮胎实际转动的弧度。每一层都专注于自己擅长的粒度,而不是让一个系统包揽所有工作。

四、240万条轨迹,350万个场景——如何在不走出实验室的情况下练就一身本领

训练一个能导航的大模型,需要海量的真实数据——机器人在各种房间里走过的轨迹、看到过的画面、做出过的决策。但真实数据的采集极其昂贵:你需要把机器人搬进一间又一间真实房间,让它反复走,全程录像,然后人工标注。这个过程慢、贵,而且难以规模化。

Mistral AI的解决方案是**完全在仿真环境中生成训练数据**。他们搭建了一套高效的模拟管线,在35万个虚拟场景(涵盖办公室、住宅、商业空间、室外环境等多种类型)里,自动生成了约240万条专家导航轨迹。每条轨迹都配有自然语言指令、沿途的RGB图像序列和对应的导航动作标注。

为了让轨迹尽可能多样,研究团队用了一种叫"最远点采样"的策略——简单说就是在可行走区域里选出尽可能分散的起点和终点组合,确保轨迹长短各异,有的只需穿过一个房间,有的甚至要跨越多个楼层。

更重要的是,为了让模型不依赖特定摄像头配置,研究者在生成数据时刻意对机器人的物理参数进行随机化:机器人高度在0.4米到1.8米之间随机变动,底盘半径在0.15米到0.45米之间变化,摄像头安装高度在机器人身高的70%到100%之间浮动,摄像头俯仰角在0度到25度之间随机设置。这相当于让同一个大脑在无数种"身体"里反复练习,最终让它对自己的具体身体形态不再有依赖感——只要有眼睛(摄像头),就能导航。

五、一个聪明的"压缩技巧"——把训练时间从几个月压缩到几天

即使有了240万条轨迹,训练效率仍然是个大问题。在常规的训练方式下,对于一条包含T个时间步的导航轨迹,模型需要针对每个时间步单独处理一次完整的历史——第一步看1帧,第二步看2帧,第三步看3帧……以此类推。一条100步的轨迹,需要处理的总帧数是1+2+3+…+100=5050帧,计算量与轨迹长度的平方成正比。面对RxR-CE这种动辄几百步的长轨迹,这种方式的计算代价高到几乎不可承受,据估计若按常规方式训练,需要数月时间。

Mistral AI提出了一个他们称为"前缀树训练"的解决方案。核心思路是:把一整条轨迹打包成一个单独的训练序列,格式是"指令 | 第0帧 | 第0步动作 | 第1帧 | 第1步动作 | … | 第N帧 | 第N步动作"。这样每一帧只需被编码一次,所有时间步的损失计算可以在一次前向传播中同时完成,计算量从平方级直接降到线性级。

但这里有个隐患:如果让模型在训练时看到历史动作的真实标注值,它可能养成一种"作弊"习惯——通过参考之前每一步的正确答案来预测下一步,而不是真正从图像视觉信息中推断。问题是,部署时根本没有"之前每步的正确答案"可以参考,只有真实发生过的观察帧。这种训练和部署之间的分裂,会让模型在实际使用中表现大打折扣。

为了防止这种作弊现象,研究团队引入了基于"前缀树"(prefix tree)结构的注意力掩码机制。前缀树是一种数据结构,可以把一组序列里公共的前缀合并成一个"主干",每条序列独特的后缀则成为独立的"分支"。通过特定的注意力掩码规则,模型在处理某个时间步的动作预测时,可以看到当前步之前的所有观测帧(主干),但看不到之前时间步的历史动作标注(其他分支)。这就像一个学生在做每道题时可以看教材正文,但看不到其他同学的答案——必须靠自己的理解作答。

这套前缀树训练方案使训练所需的token数量减少了22倍,把原本需要数月的训练时间压缩到了数天,同时学习信号的完整性完全没有损失。这对于像RxR-CE这样轨迹更长、指令更复杂的基准测试尤其关键。

六、学了规则,还要学"临场发挥"——强化学习的最后一公里

监督训练(SFT,即让模型模仿专家示范)在建立基本导航能力方面非常有效,但它有一个天然局限:专家示范永远是"最优路径",里面没有迷路后如何调整方向的示范,没有走错一步后如何恢复的示范。模型学会的是"一切顺利时应该怎么走",而不是"出了差错应该怎么救场"。当模型在真实部署中遇到偏离训练分布的状态(比如走偏了、被障碍物挡住了),就容易一错再错、越走越远。

为了解决这个问题,研究团队在监督训练之后,追加了一个在线强化学习阶段,使用的算法叫CISPO(一种基于组相对优势估计的策略梯度方法,可以理解为一种让奖励信号稳定、自我校准的强化学习变体)。在这个阶段,模型真正进入虚拟仿真环境"实战"——自己走,自己遇到错误,自己从错误中调整。

奖励函数的设计也经过了仔细考量:奖励值等于负的"距目标的测地线距离"(即绕开墙壁等障碍后的实际最短路径距离),但距离超过2米时不再继续惩罚,而是将惩罚值固定在-2。这个截断的目的是:当机器人已经离目标很近时,不让它为了在2米以内拼命压缩那最后几十厘米而做出奇怪的游走动作,而是鼓励它直接发出"停止"指令,宣告任务完成。

训练数据的选择也很讲究。研究团队先用监督训练好的模型在仿真环境里跑一遍所有任务,找出那些模型**失败**的3.5万个困难任务,然后在强化学习阶段专门针对这些难题进行训练。这就好比一个学生只在错题集里反复练习,而不是把所有题目重新做一遍——把计算资源集中在最需要提升的地方。

此外,数据收集时将同一场景的多个任务打包在同一批次里,让模型在连续几次滚动中反复面对相同的视觉环境,形成一种隐性的视觉课程——先在熟悉的房间里不断尝试,逐渐建立对这个空间布局的理解,再遇到新环境时能迁移这种空间感知能力。

强化学习阶段为R2R-CE的成功率带来了约4个百分点的提升(从73.4%涨到77.4%),为RxR-CE带来了约3.9个百分点的提升(从71.2%涨到75.1%)。

七、同一个大脑,两副不同的身体——跨机器人部署的实际验证

理论上的跨平台泛化能力,在论文中通过两台外形差异显著的真实机器人得到了验证:一台是Galaxea R1(一种高度较高、具有类人形态的移动机器人),另一台是Hiwonder JetAuto(一种体型矮小、履带式底盘的差速驱动小车)。两台机器在高度、摄像头位置、底盘结构上都有很大差异。

关键之处在于:两台机器使用**完全相同**的视觉语言模型权重和扩散策略模型权重,唯一的区别是最底层的运动控制器(负责把轨迹转化为电机指令的那一层)根据各自平台做了适配。论文首页展示的真实部署照片中,可以清晰看到两台机器都能跟随自然语言指令,在真实办公室环境中穿越门洞、绕过家具、到达目标位置。

这个结果验证了"指向式导航+物理参数随机化训练"策略的有效性:当模型在训练阶段就见过高低胖瘦各种虚拟机器人,当导航预测基于图像像素而非具体物理尺寸时,同一套权重确实可以无缝迁移到外形迥异的真实机器人上,而不需要为每个新平台重新收集数据或重新训练模型。

八、测试成绩单——数字背后的含义

Robostral Navigate在两个标准基准测试上的表现值得详细解读。

R2R-CE(Room-to-Room连续环境)是导航领域最主流的评测平台之一,要求智能体在从未见过的真实室内环境里,跟随之前未见过的自然语言指令从起点走到终点。论文使用了四个评价指标:导航误差(NE,终点与目标的距离,越低越好)、成功率(SR,在目标3米以内停止的比例,越高越好)、Oracle成功率(OS,轨迹中任意时刻距目标3米以内的比例,越高越好)以及路径加权成功率(SPL,在成功率基础上根据路径效率打折,路绕得越多扣分越多)。

在R2R-CE验证集(未见环境)上,Robostral Navigate的成功率达到77.4%,SPL达到74.2%,导航误差仅3.20米。此前最好的单摄像头方法(Qwen-RobotNav-4B)成功率为66.9%,差距达到10.5个百分点。最好的多传感器方法(配备深度传感器的Qwen-RobotNav-8B)成功率为72.1%,Robostral Navigate在只用单摄像头的情况下仍然高出5.3个百分点。

在已见环境(R2R-CE验证集seen split)上,成功率达到79.4%,峰值性能甚至达到了80.46%,说明模型的泛化能力和在训练场景上的记忆能力同样出色。

RxR-CE(Room-Across-Room连续环境)是更具挑战性的版本,指令更长、轨迹更复杂。在这个基准的英语子集上,Robostral Navigate取得了75.1%的成功率和68.7%的SPL,导航误差为3.47米。与此前最好的单摄像头方法(Qwen-RobotNav-8B,成功率73.4%,SPL 63.5%)相比,成功率提升1.7个百分点,路径效率提升5.2个百分点。SPL上的差距尤其值得关注,这意味着Robostral Navigate不仅更经常到达目标,而且走的路更短、更直接,几乎没有多余的绕行。

特别引人关注的是,在RxR-CE上,Robostral Navigate的SPL(68.7%)甚至超过了使用深度传感器的最强对手(65.7%),导航误差也更小(3.47米对比3.58米),成功率(75.1%)与对方(76.5%)仅相差1.4个百分点。这意味着在路径规划的质量和效率上,单摄像头系统已经全面超越了配备额外传感器的方案。

归根结底,Robostral Navigate想要证明的一件事是:在机器人导航这件事上,传感器的堆砌不是唯一的出路,聪明的算法设计、高效的训练方案、以及恰当的强化学习,可以让最简单的硬件配置达到乃至超越复杂传感器系统的性能水平。

这对普通人意味着什么?短期内,这类技术最直接的应用场景是各种服务机器人和配送机器人的导航能力升级——它们不需要改造硬件,只需要换一套软件,就能在从未见过的新环境里自主找路。更长远来看,如果一个导航大脑真的可以不加修改地迁移到任意平台,机器人行业的开发成本和部署门槛都会大幅下降,通用机器人的普及时间线可能因此提前。

当然,这项研究也有其局限性:目前的评测都在仿真或受控真实场景下完成,真实世界的复杂程度——拥挤的人群、移动的障碍、突然变化的光线——仍然是悬而未决的挑战。研究者自己也把Robostral Navigate定位为"通用具身智能体的第一步",而不是终点。

有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.20785查阅完整论文。

**Q&A**

Q1:Robostral Navigate只用一个摄像头是怎么判断距离和方向的?

A:Robostral Navigate不直接测量距离,而是在当前摄像头画面里标出目标位置的像素坐标,告诉机器人"朝图像里那个点走",同时预测到达时的转向角度。当目标不在视野内时,才切换为直接输出相对位移量。这种做法依赖模型从大量仿真图像中学到的视觉空间推理能力,而非物理测距传感器。

Q2:前缀树训练方法为什么能把训练时间从几个月压缩到几天?

A:传统训练方式对每个时间步单独处理完整历史,一条100步的轨迹需要处理约5050帧,计算量是轨迹长度的平方。前缀树方案把整条轨迹打包成一个序列,每帧只编码一次,所有时间步的损失在一次前向传播中同时计算,计算量降到线性级,训练token总量减少了22倍,因此速度大幅提升。

Q3:Robostral Navigate能在没有训练过的新环境里工作吗?

A:可以。论文的验证测试都在模型从未见过的全新室内环境(R2R-CE和RxR-CE的"验证未见"分集)里完成,成功率分别达到77.4%和75.1%。此外,模型还被部署到了与训练平台形态完全不同的两台真实机器人上,均能正常跟随指令导航,验证了其跨环境和跨平台的泛化能力。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

记者:兰斯门将伊文-贾万愿意加盟纽卡,前提是能成为二门

懂球帝 浏览 201 06-02

“腋下包”过时了?今夏最火的4只包包长这样,好看哭了!

Yuki女人故事 浏览 3005 06-03

瓜帅:维拉一直是最难对付的对手;多库的1对1能力让他很特别

懂球帝 浏览 434 10-25

新风格 全新宝马M3纯电版新测试谍照曝光

车质网 浏览 446 10-27

不出意外霍启山很难结婚不是因为他遇到自己

科学发掘 浏览 399 12-21

特朗普改打感情牌承认中方非常强大 疑想北京再给机会

现代小青青慕慕 浏览 461 10-19

“企业AI第一股”连亏四年!行政开支暴增3.3倍,拖累股价一个月跌超七成

财通社 浏览 318 04-10

农妇遭错判寻衅滋事罪被羁押507天 获30万元国家赔偿

扬子晚报 浏览 361 02-04

今天 | 送别杨振宁!群众含泪相送!队伍望不到头!

天津广播 浏览 523 10-24

贴广告的ChatGPT,一夜之间让全球网友破了防

机器之心Pro 浏览 433 01-18

普京:美供乌"战斧"将引发局势升级 但不会改变战场局势

环球网资讯 浏览 464 10-03

官方:利物浦与19岁前锋基兰-莫里森续约

懂球帝 浏览 207 05-28

巴媒质问:忘恩负义的阿富汗是否正成为印度代理人

澎湃新闻 浏览 501 10-14

某券商首席炒黄金期货大赚14亿?本人报警了

财通社 浏览 460 10-29

一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军

新智元 浏览 577 10-15

时髦女人都爱“这件单品”,太适合夏天了!

LinkFashion 浏览 42 07-26

券商密集实施中期分红 近90亿元红利在路上

证券时报 浏览 382 12-15

冬天适合穿什么外套?这三种款式时尚好搭

Yuki时尚酱 浏览 2886 01-08

Kimi调价风波背后的行业拐点

YOUNG财经 浏览 27 07-28

那些含金量十足的大师赛,都有德约的身影!

网球之家 浏览 413 01-07

赖清德宣布追加400亿美元用于对美军购 提及2个时间点

经济观察报 浏览 482 11-27
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除沪ICP备2023013132号-2