中文

面向具身等变视觉-语言-动作策略

机器人学 2025-09-19 v1

摘要

视觉-语言-动作策略通过大规模预训练学习跨任务、环境和具身化的操纵技能。然而,其在新机器人配置上的泛化能力仍受限。大多数方法强调模型规模、数据规模和多样性,而忽略动作空间的设计。这导致配置泛化问题,需昂贵的适配。我们通过将跨具身化预训练形式化为具身配置变换的策略等变设计,来解决此挑战。基于此原则,我们提出一个框架:(i) 为动作空间和策略设计建立具身等变理论,(ii) 引入 enforces 配置等变的动作解码器,和 (iii) 融合几何感知网络以增强具身无关的空间推理。广泛的仿真和真实世界实验表明,我们的方法提高了预训练效果,并使在新机器人具身化上的高效微调成为可能。我们的代码已公开:https://github.com/hhcaz/e2vla

关键词

引用

@article{arxiv.2509.14630,
  title  = {Toward Embodiment Equivariant Vision-Language-Action Policy},
  author = {Anzhe Chen and Yifei Yang and Zhenjie Zhu and Kechun Xu and Zhongxiang Zhou and Rong Xiong and Yue Wang},
  journal= {arXiv preprint arXiv:2509.14630},
  year   = {2025}
}