中文

NVSPolicy:用于通用语言条件策略学习的自适应新视角合成

机器人学 2025-05-16 v1 计算机视觉与模式识别

摘要

近期深度生成模型展现出前所未有的零样本泛化能力,为机器人在非结构化环境中的操作提供了巨大潜力。给定场景的部分观察,深度生成模型可以生成未见的区域,从而提供更多上下文,增强机器人在未见环境中的泛化能力。然而,由于生成图像中的视觉瑕疵以及多模态特征在策略学习中的集成效率低下,这一方向仍是一个开放挑战。我们引入NVSPolicy,这是一种通用语言条件策略学习方法,将自适应新视角合成模块与层次化策略网络耦合。给定输入图像,NVSPolicy动态选择信息丰富的视角并合成自适应的新视角图像以丰富视觉上下文。为缓解不完美合成图像的影响,我们采用循环一致的变分自编码器机制将视觉特征解耦为语义特征和剩余特征。两种特征分别输入到层次化策略网络中:语义特征指导高层元技能选择,剩余特征指导低层动作估计。此外,我们提出了若干实际机制以提高所提方法的效率。广泛实验表明,我们的方法在CALVIN数据集上实现了最现代的性能。具体而言,在所有任务上实现了90.4%的平均成功率,显著优于最近的方法。消融研究确认了自适应新视角合成范式的重要性。此外,我们在真实世界机器人平台上评估了NVSPolicy,以Demonstrate其实际应用性。

关键词

引用

@article{arxiv.2505.10359,
  title  = {NVSPolicy: Adaptive Novel-View Synthesis for Generalizable Language-Conditioned Policy Learning},
  author = {Le Shi and Yifei Shi and Xin Xu and Tenglong Liu and Junhua Xi and Chengyuan Chen},
  journal= {arXiv preprint arXiv:2505.10359},
  year   = {2025}
}