(来源:CAAI认知系统与信息处理专委会)

导语:当灾难现场需要多台机器人协作时,我们通常需要一支训练有素的操作员团队,每人各司其职,通过无线通信协调动作。但如果只有一个人呢?能否像下棋一样,从上帝视角俯瞰全局,同时操纵多个棋子完成复杂任务?这听起来像科幻电影里的场景,但一篇刚刚发表在《Science Robotics》上的论文,把它变成了现实。来自慕尼黑工业大学的研究团队开发了一种全新的“异心远程操作”范式,让单个操作员可以像操控木偶一样,同时远程控制多台机器人完成协作任务——移动速度提升了84%,任务完成速度提升了50%,而且操作员完全不觉得自己的控制力被削弱。
一、传统遥操作的困境:为什么一个人很难同时操控多台机器人?
传统的机器人遥操作几乎都是“自我中心”的——操作员通过机器人的“眼睛”看世界,第一人称视角,一一对应地控制机器人的动作。这种方式在单机器人精细操作中很直观,但一旦涉及多台机器人,问题就来了。
第一个问题是注意力切换成本。操作员每次只能在屏幕上看到一台机器人的视角,要控制另一台就得切换过去,同时还要在脑子里记住前一台机器人在做什么、周围环境是什么样。这种频繁的“心理翻译和旋转”会带来很高的认知负担。第二个问题是无法并行操作。自我中心模式本质上是顺序控制——同一时间只能操作一台机器人,当任务需要两台机器人同时移动或协同配合时,操作员只能“左移一下、再右移一下”地交替进行,效率极低。第三个问题是缺乏全局视野。每一台机器人的摄像头只能看到前方一小片区域,操作员很难对整个场景形成完整的认知。在机器人视角间反复切换,就像在几台闭路电视监控器之间来回扫视,很容易漏掉关键信息。
这些问题在单机器人操作中还能忍受,一旦需要多机器人协作——比如协同搬运一个单独机器人搬不动的大箱子——就变成了一道难以跨越的坎。这也解释了为什么多机器人系统在实际应用中往往需要多个操作员配合,而非由一个人统一调度。

二、异心远程操作:像下棋一样控制机器人
慕尼黑工业大学团队提出的解决方案,灵感来自人类大脑的一种基本认知能力——异心空间处理。
认知科学告诉我们,人脑处理空间信息有两种模式。一种是“自我中心”模式,以我为准——书在我面前,门在我左边。另一种是“异心中心”模式,以环境为准——书在灯和笔记本之间,图书馆在教堂西边三个街区。前者直观、适合精细操作;后者独立于观察者视角,擅长全局导航和空间关系理解。当我们面对复杂的空间场景时,大脑会自然地从自我中心转向异心表征,以获得更宏观的认知。
研究团队把这种认知机制迁移到了遥操作系统的设计中。他们的做法非常巧妙:把所有机器人的感知数据融合成一个统一的虚拟重建场景——每台机器人的深度摄像头数据被转成点云,在虚拟空间中拼接在一起,形成一个实时更新的三维场景。操作员戴着VR头显,可以自由选择视角俯瞰全局,然后在虚拟场景中直接用手抓住任意一个机器人模型,像操控木偶一样移动它们。
这种设计与传统俯视视角的监督控制有本质区别。它不是让操作员在一个固定视角下给机器人分配高层任务,而是允许操作员在实时渲染场景中自由走动、拉近拉远、切换角度,并对机器人的末端执行器和移动底盘进行直接的低层级控制。换句话说,操作员不是在发号施令,而是在亲手“搬动”机器人——只不过手不在物理空间中,而在虚拟重建的场景里。
更精妙的是交互细节:每台机器人被包裹在一个半透明气泡中,当操作员的手伸入气泡时,气泡会变色,提示可以建立连接。左右手可以分别控制不同机器人的不同末端执行器——左手控制机器人的左臂,右手同时控制另一台机器人的移动底座。当一个手掌同时抓取多个机器人的末端执行器时,它们会合并成一个受控单元,比如要协同搬运一个大箱子时,只需一只手就能同时移动两台机器人的手臂,保持它们之间的固定距离。正是这种“并行抓取”能力,让单个操作员得以完成需要两个人才配合完成的动作。
为了支持从精细操作到宏观调度的灵活切换,研究团队还实现了自我中心与异心中心模式之间的无缝切换——操作员可以随时“跳进”某台机器人的第一人称视角进行精细操作,完成后退出到俯视视角继续统筹全局,就像策略游戏里玩家可以随时切换到单兵视角一样自然。
三、实验揭示的互补优势:不同任务,不同视角
这套系统到底好不好用?研究团队进行了系统的用户研究来验证。15名参与者在模拟环境中完成三项实验,6名参与者用两台物理机器人(一台PR2和一台人形机器人REEM-C)在真实餐厅场景中完成清理桌子和取送订单的任务。
结果揭示了两种视角的互补性。
在需要并行移动的任务中,异心模式展现出了压倒性优势。当参与者需要同时引导两台机器人通过一系列检查点时,异心模式比自我中心模式快84%。这背后的关键机制是“机器人利用率”——异心模式下参与者有近一半的时间在同时控制两台机器人,而自我中心模式下只能轮流操作。在模拟按键测试中,异心模式比自我中心模式快50%,而且情境感知评分显著更高——参与者反馈说对全局的掌控感更好,不再需要频繁地在视角间切换来了解周围情况。
自我中心模式则在自己的主场上扳回一城。在姿势匹配实验中,参与者控制隐形的机器人模仿目标姿势——自我中心模式下的位置误差中位数比异心模式低53%。这意味着当你需要精确操作时,第一人称视角仍然是不可替代的。具身感问卷的数据印证了这一点:自我中心模式下参与者对机器人有更强“身体归属感”,他们更倾向于把机器人当作自己身体的延伸。
但两种模式有一个令人意外的共同点:参与者的“能动感”没有显著差异。无论用哪种视角,他们都觉得“是自己在控制机器人”,主观控制感相当。这是一个非常重要的发现,意味着操作员在异心模式下并不会觉得自己像个旁观者,而是依然保持着对机器人的有效控制力。
真实机器人研究进一步验证了这种互补性。在混合模式下,参与者可以根据子任务自由切换视角——他们的行为模式非常一致:移动时强烈偏好异心模式(中位使用率78%),操作时强烈偏好自我中心模式(中位使用率仅5.2%选择异心)。这种切换如此自然,以至于参与者在任务执行中几乎是不假思索地来回切换。可用性评分也印证了这一点:混合模式获得了最高的系统可用性分数,说明“两种视角可以随时切换”本身就是一个巨大的体验加分项。
四、能力边界扩展:单人完成需要多人配合的任务
这项研究的另一个亮点是它扩展了单人可完成的操作边界。
在四个协作场景验证中,操作员完成了传统方案难以实现的任务:同时移动两台机器人搬运一块大白板穿过狭窄的走廊——第三台机器人还在一旁提供额外的视觉支持;三台机器人协同将一个超大包裹吊装到一台机器人的背上,再同时用三个机器人的六个末端执行器把箱子推进货架;在工业阀门旁路场景中,三台机器人同时操作四个分布在不同位置的手动阀门——其中两个阀门需要同时开启才能保持流量。
这些任务的核心共同点是:它们都需要在同一时刻进行两个或更多机器人的精确协调。在自我中心模式下,操作员必须在机器人之间轮流切换,无法同时协调多个末端执行器;而异心模式通过并行抓取和控制,使得“同时移动两个物体”这种人类在物理世界中也很难单手完成的动作成为可能。这项研究的系统架构支持从直接遥操作到共享控制的灵活切换——例如,类人机器人的自主平衡控制和自碰撞避免由机载任务堆栈自动处理,操作员只需关注任务层面的决策。这种“半监督”模式自然地适应不同的操作员参与程度,兼顾了效率与安全。
五、这篇研究给我们什么启示?
这项工作的意义,不仅在于让一个人能同时操控三台机器人完成复杂的协作任务。它更深层的价值在于重新思考人机交互中“视角”的角色。
过去遥操作研究的主流方向是优化单机器人的控制体验——降低延迟、增强触觉反馈、改进共享控制。这些努力让远程操作越来越接近“身临其境”。但当任务需要多机器人协同时,这些进步并没有解决根本问题:操作员仍然被困在第一人称视角里,一次只能做一件事。异心遥操作提供了一个截然不同的视角——它让人从具体机器的“身体”中抽离出来,以俯瞰的姿态协调多个行动体。这让人联想到战略游戏中指挥官的角色:不需要亲自控制每个士兵的开枪动作,但可以统一调度整个团队的位置和协同时机。
当然,这项技术目前也存在局限。点云重建的质量和实时性依赖于多个深度摄像头和稳定的网络带宽,实际部署需要每台机器人配备感知设备并保持实时通信。作者团队也坦言,当前系统更适合结构化和半结构化环境,在极端复杂或动态变化的野外场景中仍有待验证。但更值得思考的是:随着机器人自主能力的提升,人类操作员的角色会不会从“直接控制者”逐渐转变为“战略调度者”?当机器人自己能完成越来越多具体操作时,人类最稀缺的能力就不再是精细的动作控制,而是对全局态势的判断、对多机器人协作的调度、对异常情况的第一时间响应。异心遥操作恰好服务于这种新的人机关系——它不要求操作员像操作自己的手臂一样控制机器人(留给自主系统),但确保在关键决策点上,人类拥有最全面的信息视野和最灵活的操作选项。
它让我们用大脑最擅长的方式——全局视角、空间思维、多任务统筹——来指挥机器人团队,而不是强迫我们像机器人一样,只能看到眼前那一片狭窄的画面。
论文信息
标题: Allocentric telemanipulation for variable-perspective multi-robot coordination
作者:Constantin Uhde, Nicolas Berberich, Simon Armleder, Florian Bergner, Gordon Cheng
机构:慕尼黑工业大学
期刊:Science Robotics, 2026年7月15日, 第11卷第116期
DOI:10.1126/scirobotics.adz7130



400-886-5570




