(来源:机器之心)
编辑|Youli
2026 WAIC 刚刚落幕,具身智能无疑是最受关注的技术方向之一。
透过这一行业盛会,一个趋势逐渐清晰:相比过去围绕单点技能展示的机器人 Demo,产业正在将关注点转向一个更现实的问题:当机器人离开精心设计的演示环境,进入家庭、工厂等真实世界后,能否稳定完成一项复杂任务?
这意味着,具身智能正进入一个新阶段:竞争重点从「让机器人学会一个动作」,转向「让机器人完成一项任务」。
然而,从「会动作」到「会做事」,中间仍存在一道巨大鸿沟。
过去几年,具身智能领域一个重要进展是机器开始具备了「理解世界并执行动作」的能力。尤其是随着视觉 - 语言 - 动作(VLA)模型的发展,机器人已经能够根据自然语言指令完成越来越多操作任务,像是抓取、整理物品、使用工具,以及简单的移动操作。
但是真实世界中的任务,很少是一个孤立动作。
比如「整理房间」「准备一顿饭」「完成仓库拣选」等典型场景任务,往往包含长达数分钟、数十个连续步骤。机器人不仅要知道当前看到什么,还需要理解任务进展、判断下一步行动,并预测自己的行为是否会影响最终目标。
对于人类而言,这些过程依靠长期经验和大脑中的规划能力自然完成,可对于机器人而言,无疑是当前最大的瓶颈之一。
那这是不是意味着,VLA 是不是已不再适配具身智能的新叙事?
答案显然是否定的,VLA 的能力边界仍在被不断探索。
今年 4 月,Physical Intelligence 发布 π0.7,通过引入多样化上下文条件(Diverse Context Conditioning),让 VLA 模型能够利用更多类型、更大规模的现实世界数据,从而在训练端进一步提升对复杂任务的泛化能力。

π0.7 的成功,再一次让业界认识到 VLA 的巨大潜力,也让业界开始思考,既然可以通过提升训练阶段的数据利用效率,让 VLA 从更多经验中学习,进一步提升模型能力,那么,在推理阶段,是否还有可探索空间?
近期,上海创智学院罗剑岚团队与智元机器人具身研究中心联合发布 τ(0)-VLA,为解决这一问题提出了新思路。
该模型提出了一种面向长程任务的「慢思考 - 快执行」分层 VLA 架构,通过将高层任务规划与低层动作执行解耦,并首次将 Test-Time Scaling 推理与世界模型推演引入具身智能上层决策,使机器人能够完成超过几十个连续决策步的长程任务衔接,并实现真实场景下的自主闭环执行。
换句话说,π0.7 尝试让 VLA 从更多的数据中提炼规律、学习经验来处理复杂问题,而 τ(0)-VLA 的破局点则在于让 VLA「深谋远虑」,在执行任务前投入算力进行长思考,想清楚再行动。

此外,值得一提的是,τ(0)-VLA 还是当下最大规模真机数据预训练的具身基础模型,预训练共使用 40115 小时真实物理世界交互数据,其中包括超 2 万小时真机数据,覆盖多种机器人形态和操作场景。
实验结果显示,在多项长程真实任务中,τ0-VLA 相比传统 VLA 模型展现出更强的任务完成能力,或许让机器人学会「先想后做」,才是解锁真实场景闭环执行的「关键钥匙」。

项目地址:https://tau0-vla.github.io/
论文链接:https://tau0-vla.github.io/tau0-vla.pdf
Github 地址:https://github.com/sii-research/tau-0-vla
Hugging Face 地址:https://huggingface.co/sii-research/tau-0-vla
当 VLA 走向「长程任务」,新的瓶颈出现
过去两年多,VLA 无疑是具身智能领域最重要的技术路线之一。
尤其是 π0.5、GR00T 等为代表的 VLA 模型推动机器人迈过了一个关键阶段:机器人开始能够理解自然语言,并根据视觉环境完成相应动作。这让机器人在抓取、移动、简单操作等「短程任务」中展现出了前所未有的灵活性。
然而,随着具身智能从实验室 Demo 展示转向真实物理场景落地的「下半场」叙事时,痛点集中爆发,VLA 模型的局限也开始显现。
原因在于,现实世界中的任务往往不是「拿起桌上的杯子」这样几秒钟即可完成的操作,而是包含多个阶段、多个决策节点的长程任务。
以「整理房间」为例,人类只需要一句简单指令,但机器人需要找到衣服、 收集衣服、 放入篮子、拿起包、挂起来、整理桌面…… 背后对应的是连续完成目标搜索、环境理解、物体抓取、空间移动、状态确认等多个步骤,并且还要在执行过程中不断根据环境变化调整策略,这是一个长时间、多步骤、不断变化的过程。
因此,只让机器人拥有精准的动作能力已远远不够,重要的是让机器人具备围绕长期目标持续规划、执行和纠错的能力。
也就是说,当前主流 VLA 路线「不灵了」,究其原因,VLA 本质是反应式(Reactive)决策范式:将当前观测与语言指令直接映射为低层动作,缺乏对任务历史、执行进度与执行后果的显式建模。
这种「看一眼、做一下」的直觉映射,在数秒级别的短程任务中表现尚可,但如果用在耗时数分钟、涉及数十个连续步骤且仅具备局部环境观测的复杂场景中,就会暴露出三个系统性缺陷:
误差累积:在数十步的长链条决策中,由于缺少中途核验与轨迹纠偏机制,机器人每一步微小或隐蔽的控制偏差(如夹爪偏移 1 毫米或底盘角度偏差 0.5 度),都会在时序上被逐级放大,最终导致任务失败;
步骤重复与遗漏:反应式范式仅依赖即时单帧或短序列观测,缺乏对「已完成 / 未完成」子任务状态的可靠记忆,导致重复执行同一无效动作,或关键步骤跳过,比如已经完成「收杯子」动作,之后又再次执行收杯子;未开柜门就尝试取物等;
目标漂移:在长上下文与复杂环境扰动下,反应式模型由于缺乏全局进度的实时对齐与反思机制,随着执行时间推移,模型的注意力会逐渐被局部的环境细节吸引,导致其行为逐渐偏离初始指令的全局意图,执行时间越长,机器人行为越容易偏离最初目标。
为此,行业迫切需要一种全新的解决方案。
τ(0)-VLA 给出的答案是:把「想清楚」与「做到位」彻底解耦,构建「慢思考」与「快执行」协同的双系统架构,并将世界模型引导的测试时计算引入具身决策,从而让机器人在行动之前具备理解任务、预测未来和选择路径的能力。
双系统架构 + 世界模型引导的测试时计算:
让机器人「先想再做」
从认知科学来看,τ0-VLA 的设计灵感源自人类脑科学的双系统理论:人类完成复杂任务时,并不会直接控制每一个动作,而是先理解目标、制定计划,再通过身体完成执行,上层负责长视野的前瞻规划与推理 —— 慢思考,下层负责高频稳定的运动肌肉反应 —— 快执行。
对应的,τ0-VLA 将机器人系统拆分为高层规划系统和低层动作系统,让两个模块分别处理不同时间尺度的问题:
高层系统(High-Level Policy),即「慢思考」系统:理解用户目标,将复杂任务拆解为多个子任务,并通过任务记忆持续跟踪执行状态,负责规划回答「下一步做什么」;
低层系统(Low-Level Policy),即「快执行」系统:负责将高层系统选定的子任务转化成稳定、实时的全身动作。
这一分层设计,避免了传统 VLA 试图让单一模型同时承担长期规划和实时控制的困境,将「决策审议」与「动作执行」彻底解耦为两个独立系统,并将昂贵的测试时算力(Test-Time Computation)倾斜给高层慢思考系统,使其可以投入更多计算进行任务推理,专注于全局规划与风险防范;同时,为低层保留了高频、低延迟的动作控制接口,保持快速稳定的动作执行,由此实现「想清楚」与「做到位」的有机统一。

下面来具体看一下。
高层系统:四大模块协同构建「子任务级束搜索」机制
高层慢决策系统运行在子任务粒度上,由四大高度协同的子模块共同构建起完整的审议与反思闭环:
Propose Model(候选任务生成):结合指令、当前观测与执行历史,生成多个候选下一步子任务。例如,针对「制作奶茶」任务,当前杯子已经准备好,模型可能提出:方案 A 加入茶;方案 B 加入牛奶;方案 C 加入配料。
World Model(世界模型):基于图像编辑模型,为每一项候选预测执行后的环境状态,输出「想象中的未来画面」,回答「如果机器人执行这个任务,未来世界会变成什么样」?例如:执行「加入牛奶」动作后,世界模型预测:未来的杯子状态、桌面状态、任务进度。需要注意的是,世界模型仅负责客观推演、不做价值判断。
Value Model(价值评估):对世界模型推演生成的未来状态进行多维度打分,精准评估该动作对总体任务目标的完成度、安全性以及隐性风险。
Reflective Model(反思):负责横向对比所有候选方案的推演结果,输出最终的子任务决策;若得分最高的方案与整体任务进度存在冲突,则触发重选与规划调整机制。
这四大模块协同构建了全新的子任务级束搜索(Beam Search)机制。这是 τ0-VLA 在具身智能推理领域的创新突破 —— 它打破了传统 LLM 在文本空间中单纯重复采样择优的局限,首次将测试时算力精准投向对真实物理世界「链式物理影响(Chain-of-Physical-Impact)」的前瞻评估。
这是除了双系统架构,τ0-VLA 另一个重要设计,是将世界模型引导的测试时计算引入具身决策过程中。
过去一年,世界模型成为业界频频提起的热门话题,很多工作关注模型能否生成逼真的未来场景,但对于机器人而言,真正有价值的问题并不是「未来画面是否足够真实」,而是「如果执行某个动作,未来世界会发生什么变化」。τ0-VLA 中的世界模型承担的正是这一角色。面对一个任务,机器人不会立即选择动作,而是先对不同方案进行未来状态预测。
而测试时计算(Test-Time Computation)是近年来大模型领域兴起的方法,传统模型能力提升主要依靠更多参数、更多训练数据集和更强算力,测试时计算则强调在模型实际推理阶段投入额外计算,让模型面对复杂问题时进行更多分析。τ0-VLA 进一步将其引入机器人领域,让机器人具备了一种类似「思考预算」的能力:简单问题保持效率,复杂问题投入更多推理资源。
配合深度思考动态路由机制,模型仅在判定为高难度的子任务节点启动深度思考,其余场景直接输出快速决策,在保证决策质量的同时兼顾推理效率。
低层动作系统:统一 40 维动作空间与高频闭环执行
低层快执行系统是一套专为真实物理部署设计的高频全身动作模型,其技术核心在于构建了统一 40 维全身动作空间。
通过统一的动作表示方式,多种形态的机器人(单臂、双臂、固定底座、轮式移动人形等)无需改变模型主干,仅需通过掩码(Masking)屏蔽无需使用的自由度,即可实现跨本体的无缝适配。
这种统一表达不仅极大地降低了具身策略对特定硬件的依赖,更为模型从异构机器人数据中学习通用的物理交互规律奠定了基础。
执行过程中,低层动作系统通过视觉反馈持续更新环境状态,并以闭环方式生成连续动作。相比一次性输出固定动作序列,闭环执行能够让机器人根据实时环境变化及时调整行为,提高面对真实世界扰动时的稳定性。
最终,通过高层任务规划与低层动作执行的紧密协同,τ0-VLA 实现了从「理解任务」到「完成动作」的全链路闭环:高层系统规划下一步目标,低层系统将目标转化为可靠执行,让机器人能够在复杂环境中持续推进长程任务。
训练:4 万小时真实机器人数据,
支撑物理世界学习
除了模型架构,数据正在成为具身智能竞争的关键因素。但不同于 LLM,机器人无法仅依靠互联网数据获得能力,需要从真实物理世界中学习动作与环境之间的关系,包括物体如何变化、动作如何影响环境以及任务如何持续推进。
因此,数据规模和数据质量,正在成为决定具身模型能力的重要因素。
为了训练 τ0-VLA,研究团队构建了一套 40115 小时真实世界机器人交互数据的训练体系,数据包含的机器人真机和 UMI 数据数据和多个公开数据集共同组成,覆盖固定机械臂、移动机器人以及双臂机器人等多种形态。
其中,包含当前具身智能领域规模领先的超过 2 万小时真机交互数据,涵盖 AGIBOT G1、ARX AC One 和 Franka 等多个机器人平台。
这些数据共同构成了一个覆盖多机器人、多任务、多场景的物理世界经验库,让模型能够学习不同机器人形态下的通用操作规律。
在训练方式上,τ0-VLA 采用了高层规划系统与低层动作系统协同训练的方式。
低层策略主要从机器人示范数据和多模态数据中学习动作执行能力,负责将任务目标转化为具体的机器人控制信号;高层规划器则利用任务分解标注、执行记忆以及世界状态变化信息,学习如何拆解任务、预测未来并选择下一步行动。
此外,团队还加入多模态联合训练数据,用于保持模型原有的视觉语言理解能力。
最终,τ0-VLA 形成了一套从感知、理解到规划、执行的完整训练体系:机器人示范数据解决「如何行动」的问题;多模态数据强化「如何理解世界」的能力;高层规划数据则帮助模型学习「如何完成长期目标」。
这也是 τ0-VLA 区别于传统 VLA 的重要地方:它训练的不只是一个动作模型,而是一套面向真实世界任务的机器人智能系统。
为了验证长程任务能力,论文没有停留在传统的抓取测试,而是在真实机器人平台上评估更加复杂的任务场景。
实验包括全屋清洁、烹饪、制作奶茶、抽屉搜索以及桌面整理等任务。这些任务的共同特点是,成功并不取决于某一个动作是否完成,而取决于整个任务链能否持续推进。

比如,在「全屋清洁」任务中,机器人进入卧室,将散落在房间内的脏衣服收集起来并放入洗衣篮;随后找到位于任意位置的手提包,并将其挂到衣帽架上;接着找到毯子并递给一名人员。
之后完成卧室内任务后,机器人离开卧室,前往客厅整理桌面上的物品,最后将炉灶旁的番茄炒鸡蛋端到客厅桌子上。
实验结果如下图表所示,引入层级规划系统(Hierarchical System)后,τ0-VLA 在 AGIBOT G1 平台上的平均成功率(SR)由 27.5% 提升至 45.0%,平均任务进度(Progress)由 80.10% 提升至 87.85%,相比 π0.5、GR00T N1.7 等主流 VLA 模型,τ0-VLA 在长程任务完成能力上表现出明显提升。
这表明,在多步骤、长时间任务中,仅依靠动作预测并不足够,高层任务规划与世界模型引导的推理机制能够显著增强机器人的执行能力。

此外,团队还测试了 τ0-VLA 在不同机器人平台上的直接执行能力。
如下图所示,在不调用高层规划系统提前下,τ0-VLA 在四项操作任务中均取得最高性能表现,其中三项任务达到 10/10 成功率。相比 GR00T N1.7、LingBot-VLA 和 π0.5 等模型,τ0-VLA 展现出更强的跨机器人形态泛化能力和稳定操作能力。

跨机器人形态的直接执行性能评估。整理化妆桌任务包含三个独立评分的指令跟随任务组。所有方法均不调用高层策略,而直接执行完整任务指令。每项任务均测试 10 轮,SR 表示成功试验次数,Progress 表示归一化后的任务里程碑完成得分,用于衡量机器人完成任务关键阶段的能力。
这表明,τ0-VLA 不仅具备任务规划能力,其低层动作策略也具备跨机器人形态的泛化能力。
τ0-VLA 背后,
一条完整的具身智能路线正在形成
从模型本身看,τ0-VLA 展示了一种从「动作智能」走向「任务智能」的系统架构。
早期阶段,行业关注的是机器人「能不能动」,竞争重点集中在硬件结构、自由度、运动速度以及控制精度等方面;随着 VLA 的发展,竞争进一步转向机器人「能不能理解指令并完成动作」,模型开始赋予机器人更强的视觉理解和操作能力。
但进入真实应用场景后,单点技能突破只是基础,机器人真正需要解决的是如何在开放环境中持续完成复杂任务。
这意味着,具身智能正在从「会动」走向「会做事」。未来机器人不仅需要生成动作,还需要理解目标、规划路径、预测结果,并在执行过程中根据环境变化不断调整。
而 τ0-VLA 提出的「先推演、后执行」范式,探索了一种新的机器人智能系统路径:在保证低层实时控制的同时,通过任务记忆、世界模型和测试时计算增强高层决策能力,让机器人从被动执行走向主动规划。
但如果把 τ0-VLA 放到团队近 3 个月的工作中会发现,它的意义还不止于一个模型。
此前,团队先后发布了面向真实世界大规模后训练强化学习系统 LWD、预训练具身世界模型 τ0-WM。如今,τ0-VLA 进一步将高层规划、世界模型与低层执行组织到长程任务框架中。
三项工作共同指向一条以「大规模预训练 + 大规模后训练」为核心的路线:预训练提供通用能力,世界模型负责预演行动后果,τ0-VLA 完成复杂任务,真实部署产生的数据再通过 LWD 回流训练,形成持续进化的数据闭环,从而使机器人的能力在部署后持续进化,真正从实验室走向复杂的真实场景。
总的来说,这一路线试图突破静态模仿学习的局限,让机器人在进入真实世界后继续学习、修正和提升。更是在向业界证明:将大模型的泛化能力与真实物理世界的强化学习数据飞轮相结合,是让具身智能真正实现规模化部署的必由之路。



400-886-5570




