中文

EgoActor:通过视觉-语言模型将任务规划落地为空间感知的具身人形机器人动作

机器人学 2026-02-05 v1 计算机视觉与模式识别

摘要

在现实世界中部署人形机器人从根本上具有挑战性,因为它要求在部分信息观测和动态变化的环境下,紧密集成感知、移动和操作,并在不同类型子任务之间稳健地转换。为了应对这些挑战,我们提出了一项新任务——EgoActing,它要求将高级指令直接落地为各种精确、空间感知的人形机器人动作。我们通过引入EgoActor进一步实例化了该任务,这是一个统一且可扩展的视觉-语言模型(VLM),能够预测移动基元(例如,行走、转向、侧移、改变高度)、头部运动、操作命令以及人机交互,以实时协调感知和执行。我们利用来自真实世界演示的仅第一人称视角RGB数据、空间推理问答以及模拟环境演示的广泛监督,使EgoActor能够做出稳健、上下文感知的决策,并执行流畅的动作推理(在1秒内),模型参数规模为8B和4B。在模拟和真实环境中的广泛评估表明,EgoActor有效地弥合了抽象任务规划与具体运动执行之间的鸿沟,同时能够泛化到各种任务和未见过的环境。

关键词

引用

@article{arxiv.2602.04515,
  title  = {EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models},
  author = {Yu Bai and MingMing Yu and Chaojie Li and Ziyi Bai and Xinlong Wang and Börje F. Karlsson},
  journal= {arXiv preprint arXiv:2602.04515},
  year   = {2026}
}