机器人技术的一大挑战是打造一个通用机器人,使其能够根据任意用户命令在非结构化环境中执行多种任务。这一努力的关键挑战是泛化:机器人必须应对新环境,识别和操纵从未见过的目标,并理解从未被要求执行的命令意图。从像素进行端到端学习,是建模此类通用机器人行为的灵活选择,因为对世界状态表示的假设很少。有了足够的现实世界数据,这些方法原则上应该能够使机器人在新的任务、物体和场景中进行泛化,而无需手工编码、特定于任务的表示。然而,实现这一目标通常仍然难以实现。
泛化需要目标任务拥有足够多样化的数据集,而收集这些数据集的成本可能高得令人望而却步。在计算机视觉等其他领域,通常利用共享的可重用数据集(例如 ImageNet)来克服这一挑战,但这在机器人技术领域已被证明难以实现。
基础模型通过在大型多任务机器人数据集上训练多任务“通才”模型,在实现可泛化行为方面展现出巨大潜力。大多数研究采用大视觉语言模型来直接预测动作,但是不同具身实体的差距还是限制了模型的泛化。
为了利用更容易获取的来源扩大数据收集,视觉和机器人社区一直致力于从人类视频中学习有意义的行为和模式。一些研究侧重于学习模拟器,这些模拟器使用生成模型从人类视频中紧密模拟机器人的真实环境,并使用这些模拟器训练策略,通过预测潜在的未来结果来做出决策。其他研究则使用互联网规模的人类视频来学习更高级的技能或 affordance。
RT-Trajectory【6】是一种使用粗略轨迹草图(sketches)的策略条件方法,允许策略有效地执行原本难以执行的新任务。在足够详细以表达低级运动为中心的指导与足够粗糙以允许学习策略在情境视觉观察的上下文解释轨迹草图之间,轨迹草图可以取得平衡。
由于人-机形态差异以及视频中手势估计的误差,即使目标位于同一位置,单纯地在机器人上重放重定位的指尖轨迹通常也无法成功完成任务。为了缓解这个问题,利用强化学习 (RL) 来学习一种在线残差策略,以增强轨迹重放。HUDOR 【12】是一种面向目标的奖励学习技术,它能够通过直接从人类视频中计算奖励来在线微调策略。重要的是,该奖励函数基于从现成的点跟踪器中获取的面向目标轨迹构建,即使人手和机械手之间存在形态差异和视觉差异,也能提供有意义的学习信号。
PROGRESSOR【14】是一个从视频中学习与任务无关的奖励函数,从而能够在无需人工监督的情况下,通过目标条件强化学习(RL)进行策略训练。该奖励的基础是对任务进度分布的估计,该估计是当前、初始和目标观测值的函数,并以自监督的方式学习。在线 RL 训练过程中,PROGRESSOR 是对抗性地反推分布外(OOD)观测值预测来优化奖励的,以减轻非专家观测值固有的分布漂移。通过将进度预测作为密集奖励,并结合对抗性反推,PROGRESSOR 能够使机器人在无需任何外部监督的情况下学习复杂的行为。
OmniManip 【17】是一种开放词汇操作方法,它弥合视觉语言模型(VLM)的高级推理与低级精度之间的差距,具有规划和执行方面的闭环能力。其提出一种以目标为中心的表征,目标的规范空间由其功能 affordance 定义,提供一种结构化且语义上有意义的方式来描述交互原语,例如点和方向。这些原语充当桥梁,将 VLM 的常识推理转化为可操作的 3D 空间约束。在此背景下,引入双闭环:一个闭环用于通过原始重采样、交互渲染和 VLM 检查进行高级规划,另一个闭环用于通过 6D 姿势跟踪进行低级执行。这种设计确保强大的实时控制,而无需 VLM 微调。
机器人动作表示为图像上的短视域二维轨迹。这些动作,或Motion Tracks,捕捉人手或机器人末端执行器的预测运动方向。实例化一种名为运动轨迹策略 (MT-π) 的 IL 策略【18】,它接收图像观测并将运动轨迹输出为动作。通过利用这个统一的跨具身动作空间,MT-π 仅需几分钟的人类视频和有限的额外机器人演示就能成功完成任务。在测试时,从两个摄像头视角预测运动轨迹,并通过多视角合成恢复六自由度轨迹。
RoboBrain【23】是一个基于 MLLM 的模型,它结合机器人和通用多模态数据集ShareRobot,采用多阶段训练策略,并结合长视频和高分辨率图像来提高其机器人操控能力。ShareRobot是一个高质量的异构数据集,可标记任务规划、目标affordance和末端执行器轨迹等多维信息。ShareRobot 的多样性和准确性,经过多个人类注释员的改进。
VidBot【26】是一个实现零样本机器人操作的框架,使用从自然单目 RGB 人类视频中学习的 3D affordance。VidBot 利用一个流水线提取显式表征,即来自视频的 3D 手部的轨迹,结合深度基础模型和运动结构技术来重建与具身无关、时间一致、度量-尺度的 3D affordance 表征。其引入一种由粗到细的 affordance 学习模型,该模型首先从像素空间中识别粗略动作,然后利用扩散模型生成细粒度的交互轨迹。该模型以粗略动作为条件,并由测试时间约束引导,用于上下文-觉察的交互规划,从而能够大规模泛化到新的场景和具身。
受人类认知 Dual-Process 理论的启发,HiRT【9】 是一种用于 VLA 模型的分层交互式模仿学习框架,可实现灵活的频率和性能权衡。HiRT 利用系统 2 提取高级、缓慢变化的信息,以指导轻量级系统 1 模块。这个由较小模型实现的系统 1 可以对环境变化做出快速反应。尽管轻量级,但 HiRT 中的系统 1 可以利用系统 2 的指导,保持与原始 VLM 相当的性能,同时获得显著的速度提升。这样,HiRT 使 VLM 保持低频运行以捕获暂时不变的特征,同时通过缓慢更新特征引导的高频基于视觉策略实现实时交互。
RoboDual【11】是一种协同双-系统,旨在利用系统 1 和系统 2 的优势并促进大型通才策略的实际部署,它可以补充机器人在通才策略和专家策略两方面的优点。基于扩散Transformer的专家,被设计用于多步动作部署,精确地以基于视觉-语言-动作 (VLA) 的通才策略高级任务理解和离散化动作输出为条件。
具身智能创业公司 PI 提出一个VLA流模型π0【13】,可以微调视觉-语言模型 (VLM) 以通过流匹配(扩散的变型)产生动作。这样能够处理高频的动作块(高达 50 Hz)和高度灵巧的任务。流匹配为模型提供了高精度和多模态建模能力,使其特别适合高频灵巧任务。π0使用预训练的VLM主干,以及具有各种灵巧操作任务的多样化跨具身数据集。添加单独的动作专家,其通过流匹配产生连续动作,这样模型可适应机器人控制,从而实现精确流畅的操作技能。然后,该模型可直接用于基于一个提示执行任务,或根据高质量数据进行微调,实现复杂的多步任务。
LMM-3DP【21】是一个可以整合 LMM 规划器和 3D 技能策略的智体框架。该方法包括三个关键角度:高级规划、低级控制和有效集成。对于高级规划,LMM-3DP 支持对环境干扰的动态场景理解、具有自我反馈的批评智体、历史策略记忆和失败后的重试。对于低级控制,LMM-3DP 利用语义感知的 3D 特征场进行精确操作。在协调机器人动作的高级和低级控制时,代表高级策略的语言嵌入与 3D Transformer 中的 3D 特征场共同参与,以实现无缝集成。
Helix 【24】是Figure.AI公司开发的一种通才视觉-语言-动作 (VLA) 模型,它将感知、语言理解和学习控制统一起来。Helix 是一个“系统 1、系统 2” VLA 模型,用于高速、灵巧地控制整个人形机器人上半身。Helix 通过两个互补的系统解决慢思考和快反应的权衡,这两个系统经过端到端的训练,可以进行通信:系统 2 是一个机载互联网预训练的 VLM,以 7-9 Hz 运行,用于场景理解和语言理解,实现跨目标和上下文的广泛泛化;系统 1 是一种快速反应的视觉运动策略,可将 系统2 产生的潜语义表征转换为 200 Hz 的精确连续机器人动作。这种解耦架构,允许每个系统在其最佳时间尺度上运行。
Being-0【27】是一个集成基础模型(FM)和模块化技能库的分层智体框架。基础模型负责处理指令理解、任务规划和推理等高级认知任务,而技能库则为低级控制提供稳定的运动和灵巧的操作。为了弥合这些层次之间的差距,提出一个连接器模块,它由轻量级视觉语言模型 (VLM) 驱动。连接器通过将基于语言的规划转化为可操作的技能命令,并动态协调运动和操作来提高任务成功率,从而增强 FM 的具身能力。由于 Being-0 的所有组件(FM 除外)均可部署在低成本的机载计算设备上,因此它能够在配备灵巧手和主动视觉的全尺寸人形机器人上实现高效的实时性能。
Figure.AI推出一个基于 π0 的演进模型 π0.5【34】,它利用异构任务的协同训练来实现广泛的泛化。π0.5 使用来自多个机器人、高级语义预测、网络数据和其他来源的数据,以实现泛化的现实世界机器人操作。该系统结合协同训练和混合多模态示例,这些示例结合图像观察、语言命令、目标检测、语义子任务预测和低级动作。该模型可以控制移动机械手执行各种家务,即使在训练期间从未见过的家庭中也可以执行。
[1] F Ebert et al., “Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets”, arXiv 2109.13396, 2021
[2] T Mu et al., “ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations” (SAPIEN), arXiv 2107.14483, 2021
[3] J Gu et al., “ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills”, arXiv2302.04659, 2023
[4] H Walke et al., “BridgeData v2: A Dataset for Robot Learning at Scale”, arXiv 2308.12952, 2023
[5] H Bharadhwaj et al., “RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking”, arXiv 2309.01918, 2023
[6] J Gu et al., “RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches”, arXiv 2311.01977, 2023
[7] A Wu et al., “One-Shot Transfer of Long-Horizon Extrinsic Manipulation Through Contact Retargeting” (Action Primitive), arXiv 2404.07468, 2024
[8] S Tao et al., “ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI”, arXiv 2410.00425, 2024
[9] J Zhang et al., “HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers”, arXiv 2410.05273, 2024
[10]S Liu et al., “RDT-1B: A Diffusion Foundation Model for Bimanual Manipulation”, arXiv 2410.07864, 2024
[11]Q Bu et al., “Towards Synergistic, Generalized and Efficient Dual-system For Robotic Manipulation” (RoboDual), arXiv 2410.08001, 2024
[12]I Guzey et al., “Bridging the Human to Robot Dexterity Gap through Object-Oriented Rewards” (HuDOR), arXiv 2410.23289, 2024
[13]K Black et al., “π0: A Vision-Language-Action Flow Model for General Robot Control”, arXiv 2410.24164, 2024
[14]T Ayalev et al., “PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement”, arXiv 2411.17764, 2024
[15]G Lu et al., “AnyBimanual: Transferring Unimanual Policy for General Bimanual Manipulation”, arXiv 2412.06779, 2024
[16]F Yan et al., “RoboMM: All-in-One Multimodal Large Model for Robotic Manipulation”, arXiv 2412.07215, 2024
[17]M Pan et al., “OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints”, arXiv 2501.03841, 2025
[18]J Ren et al., “Motion Tracks: A Unified Representation for Human-Robot Transfer in Few-Shot Imitation Learning”(MT-π), arXiv 2501.06994, 2025
[19]J Zheng et al., “Universal Actions for Enhanced Embodied Foundation Models” (UniAct), arXiv 2501.10105, 2025
[20]D Li et al., “An Atomic Skill Library Construction Method for Data-Efficient Embodied Manipulation”, arXiv 2501.15068, 2025
[21]Y Li et al., “Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation” (LLM-3DP), arXiv 2501.18733, 2025
[22]J Clark et al., “Action-Free Reasoning for Policy Generalization” (RAD), arXiv 2502.03729, 2025
[23]Y Ji et al., “RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete”, arXiv 2502.21257, 2025
[24]Figure.AI, “Helix: A Vision-Language-Action Model for Generalist Humanoid Control”, https://www.figure.ai/news/helix, Feb., 2025
[25]AgiBot World, “AgiBot World Colosseo: Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems” (GO-1), arXiv 2503.06669, 2025
[26]H Chen et al., “VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation”, arXiv 2503.07135, 2025
[27]H Yuan et al., “Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills”, arXiv 2503.12533, 2025
[28]R-Z Qiu et al., “Humanoid Policy ∼ Human Policy” (HAT+PH^2D), arXiv 2503.13441, 2025
[29]L Zheng et al., “DataPlatter: Boosting Robotic Manipulation Generalization with Minimal Costly Data”, arXiv 2503.19516, 2025
[30]Q Zhao et al., “CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models”, arXiv 2503.22020, 2025
[31]J Shi et al., “ZeroMimic: Distilling Robotic Manipulation Skills from Web Videos”, arXiv 2503.23877, 2025
[32]Y Yao et al., “Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation” (PPL), arXiv 2504.00420, 2025
[33]C Wang et al., “Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models”, arXiv 2504.13351, 2025
[34]PI, “π0.5: a Vision-Language-Action Model with Open-World Generalization”, arXiv 2504.16054, 2025
具
身
机器人
(Embodied Robot) 是基于
具
身
认知理论(Embodied Cognition)设计的智能系统,其核心思想是:智能的产生源于主体与环境的交互,通过
身
体(物理形态)与感知运动能力实现认知与
学习
。与传统
机器人
(依赖预设程序或远程控制)的本质区别在于:
- 认知与
身
体的耦合性:
身
体结构直接影响认知过程,如
机器人
的机械臂设计决定其操作物体的方式,进而影响“如何理解”物体功能。
25年3月来自Nvidia、斯坦福和MIT的论文“CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models”。
视觉-语言-动作模型 (VLA) 已显示出利用预训练的视觉
语言模型
和各种
机器人
演示来
学习
可
泛化
的感觉运动控制的潜力。虽然这种范式有效地利用了来自
机器人
和非
机器人
来源的大规模数据,但当前的 VLA 主要侧重于直接输入-输出映射,缺乏对复杂操作任务至关重要的中间推理步骤。因此,现有的 VLA 缺乏时间规划