(来源:CAAI认知系统与信息处理专委会)
从Language-conditioned Robotics到VLA,一文看懂语言如何连接机器人“大脑”与“身体”。
“帮我整理一下桌面。” 对人来说,这是一句简单指令。
但对于机器人而言,它意味着:什么东西需要整理? 哪些物体不能碰? 应该按照什么顺序操作?手臂应该如何运动?
语言,看似只是交流工具,却正在成为连接机器人感知、推理与行动的新接口。

为什么机器人需要语言?从“机械执行”到“智能理解”
随着具身智能(Embodied AI)的快速发展,机器人正在从传统的“程序执行器”逐渐转变为能够理解人类意图并主动完成任务的智能体。然而,如何让人类以自然、高效的方式向机器人表达需求,仍然是实现通用机器人应用的关键挑战。
自然语言作为人类最主要的交流方式,为连接人类意图与机器人行为提供了一种直观且灵活的交互接口。相比依赖专业编程、任务示教或复杂图形化操作界面的传统机器人控制方式,语言条件化机器人操控(Language-conditioned Robot Manipulation)允许用户通过自然语言直接描述任务目标,使机器人能够根据语言指令结合环境感知信息生成相应的操作行为。
语言赋能机器人操控主要体现在以下三个方面:
1 降低机器人使用门槛,提高可访问性
语言适配能力使机器人能够被非专业用户直接使用。正如 Tellex 等人(2020)指出:“未来的大多数机器人用户并非程序员。”传统机器人系统通常要求用户掌握底层控制逻辑、编程接口或复杂操作流程,而自然语言提供了一种更加普适的交互方式,使用户无需理解机器人内部结构即可定义高层任务目标。例如,用户只需输入:
“从厨房台面上取来红色杯子。”
机器人即可理解任务目标,并进一步完成目标物体识别、路径规划以及抓取执行。这种基于语言的“零编程”交互方式显著降低了机器人应用门槛,使机器人能够更加广泛地应用于家庭服务、医疗辅助以及工业协作等场景。
2 通过双向语言交互增强人机信任
在人机协作环境中,信任是机器人安全运行的重要基础,尤其是在护理辅助、医疗服务等高敏感场景中,用户不仅需要机器人完成任务,还需要理解机器人为何采取某种行为。语言为建立这种双向沟通机制提供了天然接口。一方面,用户可以通过语言向机器人表达复杂需求。例如:
“我有气管插管,请缓慢进食。”
机器人能够根据语言描述调整操作策略。
另一方面,机器人也可以通过语言反馈自身状态、解释决策过程。例如:
为什么选择当前动作;当前任务执行进度;是否存在潜在风险。
这种“指令—反馈—修正”的闭环交互机制,使机器人从单向执行工具逐渐转变为能够与人协同工作的智能伙伴。
3 利用语言知识提升机器人开放环境泛化能力
现实世界中的机器人任务往往具有高度不确定性。家庭环境、工业场景以及公共空间中存在大量未预先设计的物体、任务和变化情况,传统基于规则或固定程序的方法难以覆盖所有可能情况。语言模型所蕴含的大规模知识为机器人提供了一种连接世界知识与物理操作的新途径。例如,对于指令:
“把两个最轻的盒子堆叠起来。”
机器人不仅需要识别盒子的位置,还需要理解:
“轻”的物理属性;“两个”的数量关系;“堆叠”的空间关系。
通过结合自然语言理解、视觉感知以及动作规划模块,机器人能够将抽象语言目标转化为具体的感知查询、空间推理以及可执行技能序列。因此,语言先验知识能够有效提升机器人在少样本甚至零样本情况下的任务泛化能力,使其更适应动态、开放的现实环境。
语言条件化机器人操控的发展框架
基于上述优势,语言条件化机器人操控的核心目标是:将自然语言指令、任务描述或查询信息转化为基于物理环境感知的机器人运动行为。近年来,该方向已经在多个领域取得快速发展,包括:
●机械臂操作(Robot Manipulation);
●跨具身学习(Cross-Embodiment Learning);
●机器人导航(Robot Navigation)。
例如,在机械臂任务中,机器人需要根据语言指令完成抓取、移动、放置等复杂操作;在跨具身学习中,模型需要将一种机器人平台学习到的技能迁移至其他机器人;在导航任务中,机器人需要结合语言描述完成目标定位与路径规划。
语言—感知—控制三模块框架
从系统角度来看,语言条件化机器人操控通常可以划分为三个相互作用的核心模块,如图2所示。

图2 语言指导的机器人操控框架及四大主题
这些模块分别起到理解指令、感知环境状态和获取技能的作用。视觉语言模块,在指令和周围环境之间建立联系,以实现对这两个方面的更深刻理解。这两种模式的信息相互作用使机器人能够进行高级规划并执行视觉问答任务,最终提高其整体性能。控制模块,能够通过从专家设计的奖励(强化学习)和演示(模仿学习)中学习来获取低级策略。有时,这些低级策略也可以直接设计或硬编码,利用路径和运动规划算法。有两个关键循环需要强调。位于左侧的交互循环促进人机语言交互。位于右侧的控制循环表示智体与其周围环境之间的交互。
虽然“语言-感知-控制”框架提供了有用的高层次概述,但深入分析表明,核心研究问题不仅关乎这些组成部分本身,更在于语言在连接这些要素时所发挥的具体功能作用。不同研究方法以截然不同的方式运用语言来解决操控难题。作者聚焦这一视角,根据语言如何进入操控控制循环这一维度对近年研究方法进行分类。
核心亮点:打破常规,提出控制回路“四大主题”
传统的具身智能或机器人学综述,往往喜欢以算法技术栈(如 RL、IL、Planning)来进行干瘪的分类。但本文独辟蹊径,从“语言在控制回路中究竟扮演什么功能角色”出发,提出了一个极其优雅且直观的分类学体系:
●语言用于状态评估(Language for State Evaluation):语言作为“裁判”定义“对与错”,量化任务进度(奖惩函数/代价函数)。
●语言作为策略条件(Language as a Policy Condition):语言作为“方向盘”直接输入给策略网络,指导低级动作应该“怎么做”。
●语言用于认知规划与推理(Language for Cognitive Planning and Reasoning):语言作为“脑细胞”进行内部思考,拆解复杂长程任务。
●统一的“视-言-行”一体化模型(Language in unified Vision-Language-Action Models):将视觉、语言、动作表征全部收拢进一个端到端的具身大模型中。

图3 面向机器人操作任务的语言驱动方法分类框架
深度拆解:语言驱动机器人发展的四条技术路线
论文将当前研究方向总结为四类:
一、 语言作为“裁判”:状态评估 (State Evaluation)
在强化学习 (RL) 和运动规划中,定义一个“任务是否成功”需要耗费工程师巨大的代码心血。而现在,语言成了最自然、最强大的度量衡。

将人类语言转化为机器人能够理解的数学反馈(即“让语言来量化任务进度”),主要通过两大硬核路线展开:
路线一:奖励函数(Reward Functions)—— 教机器人“怎么做对”
奖励设计(Reward Design):包含传统的稀疏奖励与稠密奖励。
奖励学习(Reward Learning):利用逆强化学习(IRL)等手段从人类演示中摸索得分规律。
大模型驱动学习(FM-driven Learning):当前的绝对前沿!利用VLM 实时打分,或者直接让 LLM 自动撰写奖励代码(LLM Code Gen.,如著名的 Eureka 算法),彻底解放了需要手动调参的算法工程师。
路线二:代价函数(Cost Functions)—— 教机器人“别犯错”
文本到代价映射(Specific Text2value Mapping):将特定的语言警告(如“离易碎品远点”)直接映射为控制阻力。
大模型驱动代价映射(FM-driven Cost Mapping):利用大模型直接在 3D 物理空间中绘制“隐形红线”(如VoxPoser 算法),实现零样本(Zero-shot)的常识避障与合规接触。
二、 语言作为“方向盘”:策略条件 (Policy Condition)
当语言直接输入策略网络(Π(a|s,l))时,它便成了动作生成的 behavior-specifier(行为指引)。

●强化学习与世界模型:结合记忆机制与meta-learning(如 MILLION),机器人能根据文本指令在虚拟“世界模型”中进行预演和想象,大幅提升在未知任务上的零样本适应能力。
●3D体素与行为克隆 (BC):在多任务场景下,传统的 2D 图像输入难以进行精准控制。以 PerAct 为代表的 3D 策略模型,将RGB-D 观测和 6-DoF 动作全部虚拟化、体素化(Voxelization),实现了极高的数据利用率。行为克隆专注于训练智体复制专家示例所展示的动作和决策。目标是最小化专家的行为与智体对给定观察的预测行为之间的差异。许多语言条件模仿学习 (IL) 算法都是用基于语言的指令替换预定义的目标从目标条件 IL改编而来。如图所示,目标的典型表示。Lynch 提出多上下文模仿学习 (MCIL),它使用多个上下文目标空间训练智体,包括任务 ID、视觉图像和自然语言指令。

●基于条件扩散的策略学习:传统模仿学习(如回归MSE)在面对多峰值行为(例如左手拿还是右手拿)时,容易平均化 expert behavior 导致抓取失败。而像 StructDiffusion、ChainedDiffuser 等扩散模型,通过多步去噪(Denoising Process),生成既平滑、又严格符合指令约束的轨迹。显式策略学习方法,如图(a)所示,其学习使用直接 MSE 损失、高斯混合和离散化来直接输出动作;条件扩散模型提供一种灵活的方法,将明确的目标和语言指令集成到下游机器人任务中,大致可分为两种方法:
1.基于 DDPM 的策略学习:利用去噪扩散概率模型(DDPM)训练以语言指令为条件的策略,如图(b)所示;
2.基于生成的策略学习:通过语言引导的扩散模型生成目标图像,以驱动低级目标条件策略。

三、 语言作为“脑细胞”:认知规划与推理 (Cognitive Planning)
大模型带来的不仅仅是动作执行,更是让机器人拥有了真正能进行“分步思考、自我纠错”的大脑。

●开放世界常识推理:经典的神经符号系统(Neuro-Symbolic)受限于硬编码的知识图谱,难以拓展。而借助 LLM(如 SayCan、SayPlan),机器人能利用互联网级的常识,将诸如“帮我清理洒在桌子上的咖啡”拆解为“找抹布➡擦桌子➡洗抹布”。能够通过极少数的示例(Few-shot Prompting),瞬间揣摩出人类个性化的“整理偏好”,并将其提炼为通用的行为准则。

●代码即策略 (Code as Policies):像 ProgPrompt、DAHLIA、LYRA 这样将动作库作为API、让大模型直接生成逻辑控制代码的方法,赋予了机器人根据现场环境写代码解决未知问题的能力,甚至可以通过 Human-in-the-loop 实现终身技能学习。
●闭环交互与自我迭代(Iterative Reasoning):告别早期“一次规划,听天由命”的 open-loop 规划,现代认知规划方法(如 Inner Monologue、SC-MLLM)基于物理环境反馈(如“物体太重没拿起来”)进行多轮语言交互与实时重规划(Replanning)。
●LLM + PDDL/行为树:为了防止大模型信心满满地“胡说八道”(Hallucination),LEMMA-Plan 和 BETR-XP-LLM 将大模型产生的步骤翻译为可验证的 PDDL 规划语言或行为树(Behavior Trees),实现了“理智的逻辑约束+ 灵活的常识泛化”。

四、统一的 VLA 大模型(Vision-Language-Action Models)
这是 2025/2026 具身智能领域最狂热的浪潮:不再区分规划器和执行器,而是把感知、语言、动作全部融入一个统一的大模型(Embodied Foundation Model)。

●感知升级:让 VLA 拥有“肉身感知”:
1.3D 化: 传统的 2D 图像输入无法应对物理世界的深度和尺度变化。像 SpatialVLA、PointVLA、BridgeVLA 分别通过位置编码、3D点云注入及正交投影,让 2D VLM 拥有了极强的空间几何直觉。
2.感觉(Touch): 在需要精细操作的接触密集任务中,单靠视觉(Vision)极易失败。Tactile-VLA、OmniVTLA、ForceVLA 引入了力控和触觉传感器(如 GelSight)的感知嵌入,甚至能理解指令中“轻轻地握住”和“用力捏”的语义区别。
●推理升级:想好再动,预知未来:
1.CoT 与世界模型: CoT-VLA 支持在输出控制指令前生成“视觉中间目标图”。WorldVLA 和DreamVLA 则将预测未来轨迹转化为预测隐式“未来世界表征”,机器人得以在脑海中虚拟预演后果。
2.防止遗忘: 针对机器人在微调过程中会忘记通用语义常识(Catastrophic Forgetting)的通病,ChatVLA-2 和Knowledge Insulation 提出了梯度隔绝技术与混合专家网络(MoE),既让肢体变敏捷,又护住了通识性的“大脑”。
●动作升级:高频输出,身手敏捷:
1.早期 VLA(如 OpenVLA)受限于自回归的离散 token 预测,动作精度低且输出频率慢(约 3-6 Hz)。
2.Π0 家族(如Π0、Π0.5)通过添加连续的 Flow Matching / Diffusion Action Heads,直接在 VLM 后端生成 50 Hz 的连续流畅运动轨迹,实现了极其丝滑、灵巧的操作。
3.FAST(频域动作序列 Tokenizer)则通过离散余弦变换压缩时域冗余,将训练速度提升了 5 倍。
●适配升级:控制高频与极致部署:
1.OpenVLA-OFT通过优化并行解码算法、Action Chunking以及连续 L1 线性回归,将 OpenVLA 的部署推理频率暴涨 26 倍,在保持原有语言理解力的同时,大大降低了控制延迟。
大模型是具身智能的终点吗?行业正在面临三大‘灵魂拷问’!
在语言驱动的机器人世界里,感知、语言、控制被死死地绑在了一根绳上。大模型虽然给了机器人“说人话、看世界”的能力,但也推倒了第一张骨牌——大模型一旦“脑抽”或者“卡顿”,机械臂就会直接失控,导致任务满盘皆输。
针对这个痛点,综述在最后部分抛出了 3 个针对当前具身社区最针锋相对、直击灵魂的辩题:
辩题一:大规模“视-觉-动”端到端大模型(VLA),是实现机器人泛化性的最直接路径吗?
●正方派: Scaling Law 已经在语言和视觉大模型中被证实。只要我们通过类似 Open X-Embodiment 的跨平台数据集(Cross-Embodiment)或者人类视频(EgoVLA),把机器人控制数据堆到一定量级,通用物理泛化必然涌现。
●反方派:物理世界对误差的容忍度为零。一个单词拼错无伤大雅,但在抓取时偏差 1 厘米就会导致花瓶摔碎。异构机器人的物理特性各不相同,纯黑盒的 Scaling 很容易陷入“捷径学习”(Shortcut Learning)和死胡同。
辩题二:学习到的世界模型(World Models),能否为机器人提供高鲁棒性规划所必需的“远见”(预判能力)?
●正方派:想象力(Imagination)是高级智能的体现。在潜空间世界模型(如 DreamerV3)里预演和自我探索,不仅安全,还能极大提升多任务的泛化性能。
●反方派:触觉、摩擦力、柔体变形等物理动力学极难被黑盒网络 100% 模拟。世界模型的微小偏差会在长程规划中迅速累积(Distribution Drift),导致机器人在脑海里完美,现实一碰就碎。
辩题三:模型规模的无限扩张(Scaling Law),与物理控制中所要求的严格实时性约束之间,该如何权衡?
●控制周期通常有着严格的时间 deadline(比如50 Hz ~ 200 Hz当前百亿参数大模型的推理通常需要数百毫秒,甚至依赖不稳定的云端计算。如何通过异步架构、剪枝量化或“快慢脑联合控制”(云端慢规划+ 本地高速力控),是工业落地必答的硬伤题。
虽然这些话题贯穿了整个机器人研究领域,但在语言驱动的机器人操作中显得尤为关键。在这种场景下,抽象的“语言”必须与实时的“感知”紧密绑定(Grounded),进而指导具体的“物理交互”。这构建了一个高度耦合的复杂系统——任何一个领域的微小失误,都可能引发级联反应,最终导致整个操作任务的彻底失败。
因此,这些前沿技术虽然为机器人注入了全新的能力,但也引入了诸多必须解决的严峻挑战,唯有攻克它们,才能实现真正可靠且具备通用泛化能力的机器人操作。
这篇论文不仅仅是一篇综述,更是具身大模型时代工程开发与学术探索的高阶指南。
论文题目: Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation
论文/arXiv链接: arXiv:2312.10807v7(Accepted by IJRR)



400-886-5570




