中文

从想象的未来到可执行的动作:基于混合潜在动作的机器人操作

机器人学 2026-05-13 v1 计算机视觉与模式识别

摘要

视频生成模型通过预测长期未来观察来为机器人操作提供了鼓舞人心的想象机制,但有效地利用这些想象的未来进行动作执行仍然具有挑战性。现有方法要么将预测帧条件化于策略上,要么直接将生成的视频解码为动作,两者都受制于视觉真实性与控制相关性之间的错位。结果是,预测的观察强调感知保真度,而非与状态转换相关的动作导向原因,导致间接且不稳定的控制。为解决这一差距,我们提出了MoLA(Mixture of Latent Actions,潜在动作混合模型),一种面向控制的界面,将想象的未来视频转化为可执行的表示。与将预测帧直接传递给策略不同,MoLA利用预训练的逆动力学模型的混合,推断由生成视觉过渡所暗示的潜在动作混合。这些具有模态感知性质的逆动力学模型捕获了补充语义、深度和光流线索,提供了结构化且基于物理的动作表示,将视频想象与策略执行连接起来。在模拟基准(LIBERO、CALVIN和LIBERO-Plus)和实际机器人操作任务上,我们的方法在任务成功率、时序一致性和泛化能力方面实现了持续的提升。

关键词

引用

@article{arxiv.2605.12167,
  title  = {From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation},
  author = {Yajie Li and Bozhou Zhang and Chun Gu and Zipei Ma and Jiahui Zhang and Jiankang Deng and Xiatian Zhu and Li Zhang},
  journal= {arXiv preprint arXiv:2605.12167},
  year   = {2026}
}

备注

ICML 2026