(来源:科技行者)

这项由阿里巴巴集团高德CV实验室主导的研究,以技术报告形式发布于2026年7月11日,论文编号为arXiv:2607.10383。感兴趣的读者可通过该编号在arXiv平台检索完整论文。
设想你正在指挥一个机器人完成一系列任务:先让它去找到最近的星巴克,然后让它跟着你走,再让它帮你找到会议室里的椅子,接着按照你的口头指示走一段路,最后让它精确到达地图上的某个坐标。对于大多数机器人来说,这简直是天方夜谭——它们往往只擅长其中一件事,一旦换了任务就抓瞎。而高德CV实验室最新推出的ABot-N1,正是要打破这种局面,用一套统一的系统优雅地完成所有这些任务。
这项研究的核心挑战其实和人类大脑的工作方式密切相关。当你想开车去一个陌生地方时,你的大脑会同时做两件事:一方面在高层次上规划路线、识别路标、判断要走哪条路;另一方面又在毫秒级的速度上控制方向盘、油门和刹车。这两件事的节奏完全不同,前者慢而深思熟虑,后者快而即时反应。现有的导航机器人大多把这两件事塞进同一套神经网络里处理,结果就像让一个人同时写诗和打鼓——两件事都做不好。ABot-N1的创新之处,正在于把这两件事彻底分开交给两个专门的系统来做。
一、机器人导航的"老大难"问题
要理解ABot-N1为什么重要,得先聊清楚机器人导航领域长期以来存在的三个令人头疼的难题。
第一个难题叫做"坐标漂移"。当我们告诉机器人"向前走16.3米"时,这个坐标是相对于机器人当前位置计算出来的。但问题是,城市里使用的普通地图(叫做"标准清晰度地图",简称SD地图)精度并不高,加上定位误差,算出来的目标点很可能落在了花坛里、车道上,或者某个根本走不过去的地方。以前的系统会傻乎乎地往那个坐标冲,结果撞上花圃或者闯入机动车道。
第二个难题叫做"语义搜索与精准到达的纠缠"。当机器人要寻找某个物体时,比如"找到会议室的椅子",它需要先大范围搜索(这是随机探索的过程),找到之后再精准接近(这是确定性执行的过程)。把这两个性质完全不同的阶段捆绑在一起训练,会导致系统行为不稳定,而且出了问题也不知道是"没找到"还是"找到了但走不过去"。
第三个难题叫做"黑箱不透明"。现有的端到端神经网络导航系统就像一个黑盒子:摄像头拍到画面,直接输出移动指令,中间发生了什么完全看不见。机器人转错了弯,你不知道是因为没看清楚路标、还是判断逻辑出了问题、还是执行动作时出了差错。这对于需要在复杂城市环境中安全运行的机器人来说,是个很严重的隐患。
这三个问题的根源其实是同一个:把"想清楚该做什么"和"把动作执行好"这两件性质不同的事情强行捏合在一起处理。ABot-N1的核心思路,就是把它们彻底分开。
二、"慢脑"加"快手":双系统架构的精妙设计
ABot-N1采用了一种叫做"慢快双系统"的架构,这个名字本身就把核心思路说清楚了:一个慢悠悠想清楚该怎么做的"大脑",加上一个快速执行动作的"手"。
慢系统基于40亿参数的视觉语言大模型(Qwen-3.5-4B)构建。它的工作节奏相对较慢,每隔一段时间才运作一次,但每次运作都在认真"想问题"。它接收四类输入:近期走过路段的历史画面(相当于短期记忆)、当前时刻的三视角观察图像(左、前、右三个摄像头同时拍摄)、任务描述语言,以及上一次自己做出的决策。把上一次决策也作为输入,是为了让系统前后行为保持一致、不出现忽左忽右的摇摆。
慢系统的输出有两类,共同构成了整个系统的关键创新——"双模态导航信号"。其一是文字形式的推理链(论文里称为Chain-of-Thought,简称CoT),相当于把自己的思考过程用自然语言写下来,比如"目标物体玻璃门在前方视角中可见,被浅色结构框住,两侧有低矮绿色长椅;路径规划:向前直走穿过反光地板,绕过中间绿椅,靠近中央通道朝玻璃门走去"。其二是"像素目标"——在当前图像上标出两个坐标点:一个叫"可达像素",指的是前方3到5米内那个机器人接下来应该走向的安全可通行地点;另一个叫"目标像素",只在最终目的地(物体、店铺入口、跟踪人物)出现在画面中时才标出,指向那个终点本身。
快系统基于20亿参数的视觉语言模型(Qwen-3.5-2B)构建。它以高频率持续运行,每次都接收当前的实时画面、慢系统产出的推理链文字和像素坐标点、以及慢系统标注像素时用的参考图像。它的输出是连续的SE(2)轨迹点——也就是在机器人自身坐标系里的一系列(x, y, 方向角)坐标,告诉机器人接下来的五个移动步骤该往哪走。室外步幅较大,室内步幅较小,以此平衡效率和避障需求。快系统里有一个叫做QFormer的交叉注意力模块,负责从视觉特征和慢系统输出中提炼出最关键的导航相关信息,再交给一个小型神经网络解码成具体的位移指令。
两个系统的运作是异步的:慢系统每隔若干帧才更新一次,快系统则不间断运行,在慢系统两次更新之间,它会持续追踪慢系统上次标注的像素坐标,用视觉方式"盯住目标"。这样一来,深度思考不会拖慢控制节奏,而控制的精度也不受思考延迟的影响。
五种不同的导航任务,在这套架构下以一种优雅统一的方式被处理。点位导航时,可达像素标在占地图中安全可通行的下一个路径节点上,不需要单独标目标像素(因为目标坐标已被慢系统内部消化);指令跟随时,可达像素标在近期可行路径上,快到终点时才出现目标像素;物体搜索时,可达像素指引探索,一旦发现目标物体就出现目标像素;兴趣点(POI)导航时,可达像素遵循点位导航的逻辑,目标像素在店铺入口出现时被标出;人员跟随时,两类像素都对准被跟踪人物的脚部中心,若人物暂时离开视野则目标像素置空、可达像素改为标注下一个可预测路径点。
三、用三千万条数据"喂养"出来的通才
一个系统能不能真正搞定五种任务,数据质量和数量是最核心的决定因素。ABot-N1的预训练数据总量达到了三千万条样本,覆盖了所有五种导航任务。
数据来源方面,研究团队维护了一个高质量的仿真场景库:800多个室内场景和22个室外场景,全部用三维高斯泼溅技术(3D Gaussian Splatting,一种让虚拟场景看起来像真实照片的技术)重建。每个场景都经过人工标注,划分了"可通行区域"和"禁止通行区域",包括行人道、斑马线、建筑入口,以及机动车道、草坪、静止障碍物等。每段轨迹数据分为两类:专家示范轨迹(最优路径)和DAgger纠偏轨迹(从偏离状态恢复到正确路径的轨迹)。后者特别重要,因为真实部署中机器人总会遇到各种意外,得学会自我纠正。
三千万条样本在慢系统(1330万条高层数据)和快系统(1640万条低层数据)之间分配。以点位导航为例,慢系统的训练数据约有236万条,每条样本的输入包括三视角观察、一个加了噪声的全局目标坐标,以及50%概率附上历史画面和历史预测。加噪声的原因前面提过:真实城市里的坐标会漂移,所以训练时就要模拟这种漂移,让模型学会在坐标不准确时依靠视觉判断找到可通行路径。快系统的点位导航数据约有620万条,包含当前画面、历史帧、慢系统的最新标注结果和全局坐标目标,监督信号是接下来5步的相对位移。
指令跟随任务的数据构建尤为精细。研究团队从约3万段参考轨迹出发,用Qwen-3.5-27B大模型做了两阶段标注:第一阶段把每段长指令分解成一系列短子指令("走出卧室门"、"沿走廊直行"、"进入另一个卧室"……);第二阶段把每条子指令与轨迹中对应的帧段对齐,标注每帧"当前执行哪条子指令"和"刚完成了哪条"。可达像素则通过几何方法自动生成——沿参考轨迹向前看固定距离,找到安全的落脚点并投影到图像上。
物体搜索任务采用了一个叫做"数据飞轮"的迭代方式来生成高质量的推理链标注。先用高能力大模型生成约2万条种子标注,每条标注包括目标可见性判断、空间位置描述、路径规划和动作序列;再用这些种子数据微调一个小模型(Qwen-2.5-VL)作为标注员;这个小模型再去标注更多数据;新标注通过与A*最优路径的一致性过滤后,继续迭代优化。最终收敛于约11万条高质量样本,既消除了昂贵大模型的依赖,也减少了幻觉问题。
兴趣点导航面临的最大挑战是没有现成的三维仿真场景可用——街道商业区的3D重建在现有公开数据集中几乎缺席。研究团队的解法是从静态街景照片出发,建立了一个三阶段标注流水线:首先用5.5万条人工标注和22万条规则模型伪标签得到种子数据,再用MoGe-V2单目深度模型估计每张图片的深度和可通行区域,从而生成像素坐标;再把这套流程蒸馏进一个Qwen-3.5-4B小模型(只训练大语言模型部分,视觉编码器冻结不动),让它能够快速处理大批量数据;最后用这个模型处理了约3100万张街景图片,筛选出约800万条有效正样本,加上合成三视角和50万条"目标不存在"的困难负样本,最终构建了300万条慢系统训练数据。
人员跟随任务则借助了开源的人体运动轨迹数据,在Habitat仿真平台上重放,用A*规划机器人在1.2米、1.5米和2.0米三种跟随距离下的跟踪轨迹。场景分为三类:单目标跟踪(只有一个目标人物)、干扰跟踪(有其他相似外貌的路人干扰)和歧义跟踪(多个人物与目标外貌相似,需要通过语言描述做出区分)。慢系统学习在目标可见时把两类像素对准人物脚部,目标暂时消失时把可达像素切换到预测路径上。
四、用强化学习让"大脑"不只学模仿,还学成果
预训练只是起点。模仿专家示范的数据,能让模型学会"在正常情况下该怎么做",但不能保证它在面对复杂、危险情境时做出最优决策。更根本的问题是,模仿学习只优化每一步的预测精度,而不是直接优化"任务最终有没有完成"这个结果。
为此,ABot-N1的慢系统在预训练结束后还经历了一个叫做GRPO(Group Relative Policy Optimization,组相对策略优化)的强化学习阶段。这种方法的逻辑是:给定当前状态,让模型生成一批不同的回答(每批称为一个"组"),对每个回答打分,然后以组内相对分数作为优化信号——比组内平均好的回答得到鼓励,比平均差的得到惩罚。
评分体系由三部分组成。格式奖励是个开关:输出必须符合预定义的JSON格式,否则后面两项奖励直接清零,因为格式混乱意味着快系统根本没法解析慢系统的输出。目标对齐奖励衡量预测的像素坐标与真实标注坐标之间的距离,采用指数衰减形式,距离越近奖励越高,但在任意视角漏报坐标都会触发很大的惩罚。安全间距奖励把预测坐标反投影到三维空间,检查周边最近非可通行区域的距离。当距离超过安全阈值时,奖励保持一个负的固定值(合法的贴近障碍物操作如穿过门口不受额外惩罚);当距离低于安全阈值时,惩罚按指数级急剧增大;闯入禁止区域或输出崩溃则触发惩罚下限。
训练数据的采样策略也经过了严格的理论推导。研究团队将样本按照距非可通行区域的距离分成三类:安全区(距离充足,奖励信号稳定、信噪比高)、临界区(略低于安全阈值,奖励方差较大但提供边界细化信号)和危险区(接近阈值极限,奖励方差最大但梯度幅度最强,是唯一能提供强制安全约束梯度的样本)。通过对奖励函数做一阶泰勒展开,并要求各类样本的梯度贡献满足信号稳定性条件,研究团队推导出了一个5:3:2的采样比例(安全:临界:危险),以此平衡训练稳定性和安全约束的有效执行。距离过近、奖励方差超出稳定预算的样本则被丢弃。
整个强化学习阶段处理了约50万条点位导航样本,但框架设计完全任务无关:安全间距奖励只依赖场景几何信息,格式奖励只依赖输出结构,只有目标对齐奖励需要针对不同任务重新定义(比如指令跟随换成终点距离,物体搜索换成目标掩码重叠率,人员跟随换成人物脚部中心距离)。
五、两个全新的城市导航评测基准
在发布ABot-N1的同时,研究团队还开源了两个全新的导航评测基准,因为现有的开源基准在城市尺度导航评测上几乎是一片空白。
第一个是ABotN-PointBench,专门测试坐标导航能力,涵盖31个真实场景(16个室内、15个室外),包括购物中心、公园、路口和日常通勤走廊,全部用高精度三维高斯泼溅重建。每个场景都经过人工标注,划分了合法可通行区域和违规区域,并用A*算法生成最短可行路径作为参考轨迹。共生成465条参考轨迹,室外按距离分为低(5-20米)、中(20-35米)、高(35-50米)三个难度级别,每个级别各75条;室内分低难度(8条每场景)和高难度(8条每场景)。室外评测标准相对宽松——碰撞次数少于3次即算成功,原因是大规模室外占地图标注难免有细微误差;室内标准极为严格——零碰撞才算成功。
第二个是ABotN-POIBench,专门测试兴趣点导航能力。研究团队选取了11个真实商业区,覆盖约12.6万平方米,共有163个不同的兴趣点,包含超过3800万个高斯点和约441万个网格面片。每个兴趣点都标注了名称和物理入口——入口被表示为地面平齐的水平边框,而不是单一坐标点,这样判断"是否成功到达入口"时有更合理的容差。起始位置在可通行区域内随机采样,并人工确认每个起始视角下目标店铺的招牌至少部分可见。评测以距入口2米为成功标准,同时报告相对A*路径的路径效率。
六、在五项任务上的全面评测
ABot-N1的评测覆盖了模拟环境中的五项任务,以及真实机器人的实地部署。
在指令跟随任务上,ABot-N1在R2R-CE Val-Unseen分集上取得导航误差3.32米、成功率70.89%、路径效率67.5%的成绩,刷新了所有指标的最优纪录,甚至超越了需要额外深度传感器和里程计的老方法。在RxR-CE分集上,导航误差降至3.13米,为所有已报告方法中最低,成功率73.85%仅略低于在大量领域内数据上专门训练的Qwen-RobotNav-4B(75.2%)。值得注意的是,ABot-N1使用的只是左前右三个固定摄像头,而非完整360度全景输入。多任务联合训练的版本(ABot-N1)不仅没有损害指令跟随性能,反而在R2R分集上比单任务微调版本(ABot-N1+)高出2.63个百分点,在RxR上高出2.95个百分点,证明跨任务迁移切实存在。
在物体搜索任务上,研究团队把原始OVON数据集做了重新策划:从物体首次出现在视野中的帧开始,剥离掉搜索阶段只保留"发现后接近"阶段,这样能更清晰地评测系统的识别和最后米精度。ABot-N1将成功率从ABot-N0的73.2%提升到84.9%,路径效率从35.4%跳升至51.8%,到达时距目标的平均距离从1.44米压缩到0.82米,缩短了将近一半。单任务微调版本成功率略高(85.5%),但多任务版本在路径效率上反超(51.8%对50.8%),说明多任务训练带来的迁移不仅没拖后腿,反而在效率维度上有所增益。
室外坐标导航方面,ABot-N1达到92.9%的总体成功率,比ABot-N0的76.9%提升16个百分点。最困难的高距离组(35-50米)从65.3%跳升至88.0%,提升幅度超过22个百分点。这一巨大差距的根源在于:没有可达像素引导的旧方法,会沿着最短几何路径笔直冲向目标坐标,哪怕这条路途经车道或者禁止区域;ABot-N1的慢系统每步都重新标注当前图像上的可通行落脚点,自动把路径校正到合法区域。室内零碰撞成功率从89.6%提升至95.4%,困难组从87.5%提升至95.8%,在精细室内环境中也展现出稳健性。
兴趣点导航方面,ABot-N1将入口到达成功率从此前最优方法POINav的42.3%提升至77.3%,绝对提升35个百分点,路径效率从40.3%提升至72.6%。这一任务的慢系统只需要单帧观察就能工作(不需要历史记忆),快系统则直接复用点位导航的执行能力——这种设计让跨任务能力复用在这里体现得最为充分。
人员跟随方面,在单目标跟踪场景下ABot-N1达到90.1%成功率/89.8%跟踪率,较ABot-N0提升3.2/2.2个百分点,同时碰撞率从8.54%降至4.27%。在干扰跟踪场景下,跟踪率从75.4%大幅跳升至84.4%,说明多任务训练显著增强了慢系统在存在干扰物时的身份判断能力。在歧义跟踪场景下,成功率提升2.7个百分点,跟踪率提升8.3个百分点,验证了"目标消失时目标像素置空、可达像素回退到预测路径"这一机制对应对严重遮挡的有效性。
七、让研究走出实验室:真实机器人上的部署
ABot-N1被部署在高德自研的TuTu四足机器人平台上,该平台配备了全向激光雷达、RTK-GNSS定位系统和覆盖270度水平视角的三摄像头阵列。为了能在机器人的板载计算单元上流畅运行,研究团队把计算硬件从Jetson Orin NX升级到Jetson AGX Orin 64GB,并把原来分散的感知栈(BEV占地图生成、腿部里程计、障碍物过滤)与导航推理管线深度整合为单一框架,消除了进程间通信开销。
在真实部署中,慢系统被缩减为20亿参数版本,快系统换用了3亿参数的DiT(扩散变换器)加DINOv2-Base视觉编码器的轻量组合,整个系统以10Hz的控制频率运行,慢系统以更低频率异步更新,快系统则持续运行追踪最近的慢系统输出。
在实际测试中,研究团队记录了五类任务的代表性片段。点位导航任务中,机器人展示了在狭窄道路绕行停放车辆、主动绕开施工区禁止通行区域、在岔路口选择正确分支、以及在红灯前停下等绿灯再过斑马线等行为。这最后一条尤其有趣——等红灯这种行为在纯坐标导航框架下根本无法产生,正是因为慢系统理解了交通规则并用可达像素传达了"现在不能走"的指令。物体搜索中,机器人在树影斑驳的远距离下找到了公园长椅、通过空间关系推理区分了"放着水瓶的那把椅子"和其他椅子、以及在部分遮挡情况下找到了消防栓。兴趣点导航中,机器人从大角度斜视下识别了"兰州牛肉面"的店招、在通往麦当劳途中绕开了街道障碍物、并在通往瑞幸咖啡的路上判断出一处台阶过高无法通行转而找到可通行入口。指令跟随任务中,一段从下楼梯到抵达吧台的完整室内导航被完整演示,慢系统在每个关键节点输出了清晰的子指令进度状态和像素标注。人员跟随任务中,机器人在有其他行人干扰时稳定跟踪了目标、在对方上楼梯时跟随攀爬、在目标转过室内拐角时及时调整朝向。
说到底,ABot-N1做的事情,是把机器人导航从"专科医生"推向"全科医生"的方向迈出了扎实的一步。以前你需要五台不同的机器人分别搞定五种导航任务,现在一台机器人用一套统一的参数就能全部搞定,而且在每项任务上都达到或超越了此前的专用系统。更重要的是,这套系统不是一个黑盒:它会"说出"自己的推理过程,在图像上"指出"自己认为该走哪里,这让排查问题、判断安全性变得真实可行。
研究团队在论文中也诚实地指出了现有局限:人员跟随任务中碰撞率在多任务训练后略有上升,说明激进的接近策略需要在后续训练中加入更明确的碰撞惩罚来约束。此外,GRPO强化学习阶段目前只在点位导航任务上验证了规模化效果,扩展到其他四个任务的实验尚待完成,这也是研究团队下一版本ABot-N1.1的计划目标之一。
对于对这个领域感兴趣的读者来说,一个值得深入思考的问题是:当机器人既能自主推理又能清晰解释自己的决策时,我们如何界定人与机器之间合理的信任边界?另一个有趣的问题是:这套"像素目标作为通用接口"的思路,能否迁移到机械臂操作、无人机飞行等其他体化智能场景?感兴趣深入探索的读者,可以通过arXiv编号2607.10383找到完整论文,项目主页也提供了演示视频,网址为amap-cvlab.github.io/ABot-Navigation/ABot-N1/。
Q&A
Q1:ABot-N1的"慢快双系统"架构和普通机器人导航系统有什么本质区别?
A:普通导航系统把"想清楚该做什么"和"执行动作"塞进同一个神经网络,就像让人同时写作文和打鼓。ABot-N1把这两件事分给了两个专门系统:慢系统(40亿参数)负责理解场景、规划路径、产生推理文字和图像坐标点;快系统(20亿参数)负责把这些信息转化为实时移动指令。两者异步运行,各司其职,速度和质量都有明显提升。
Q2:ABotN-POIBench和ABotN-PointBench这两个新基准解决了什么问题?
A:现有导航基准要么只评测单步预测(不考虑连续运动中的累积误差),要么只测试街道场景(忽略商场、室内等复杂场景),要么不考虑机器人有没有闯入车道或违规区域。这两个新基准在真实场景的三维高斯泼溅重建上做全程闭环测试,室内要求零碰撞才算成功,室外要求少于3次碰撞,兴趣点基准要求机器人真正到达店铺入口2米以内,更贴近实际部署需求。
Q3:ABot-N1用GRPO强化学习训练之后,机器人在安全性上有什么具体改变?
A:强化学习阶段设计了一个非对称安全奖励函数:在安全区域内惩罚保持平稳,不惩罚正常的贴近障碍物操作(比如走过门口);一旦进入危险区域,惩罚按指数级急剧增大;完全闯入禁止区域则触发最大惩罚。配合5:3:2的安全/临界/危险样本采样比例,让模型在不损失正常导航能力的前提下,对"快要走进违规区域"这件事变得极度敏感。



400-886-5570




