ROCKET-2:通过跨视角目标对齐引导视觉运动策略
人工智能
2025-07-10 v2 计算机视觉与模式识别
机器学习
机器人学
摘要
我们旨在开发一种语义清晰、空间敏感、领域无关且对人类用户直观的目标指定方法,以引导智能体在3D环境中的交互。具体而言,我们提出了一种新颖的跨视角目标对齐框架,允许用户使用来自其自身相机视角的分割掩码来指定目标物体,而非使用智能体的观察视角。我们强调,当人类与智能体的相机视角存在显著差异时,仅靠行为克隆无法将智能体的行为与人类意图对齐。为解决此问题,我们引入了两个辅助目标:跨视角一致性损失和目标可见性损失,以显式增强智能体的空间推理能力。基于此,我们开发了ROCKET-2,一种在Minecraft中训练的最先进的智能体,与ROCKET-1相比,其推理效率提升了3至6倍。我们表明,ROCKET-2能够直接解释来自人类相机视角的目标,从而实现更好的人机交互。值得注意的是,ROCKET-2展现了零样本泛化能力:尽管仅在Minecraft数据集上进行训练,它仍能通过简单的动作空间映射,适应并泛化到诸如Doom、DMLab和Unreal等其他3D环境。
引用
@article{arxiv.2503.02505,
title = {ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment},
author = {Shaofei Cai and Zhancun Mu and Anji Liu and Yitao Liang},
journal= {arXiv preprint arXiv:2503.02505},
year = {2025}
}