通过零样本新视角合成实现视角不变策略学习
机器人学
2025-06-03 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
大规模视觉运动策略学习是开发可泛化操作系统的一种有前途的方法。然而,能够部署在多样化本体、环境和观测模态上的策略仍然难以实现。在这项工作中,我们研究如何利用来自世界大规模视觉数据的知识来解决可泛化操作的一个变化维度:观测视角。具体来说,我们研究单图像新视角合成模型,该模型通过在给定单张输入图像的情况下从替代相机视角渲染同一场景的图像,来学习具有 3D 感知的场景级先验。为了在多样化的机器人数据中实际应用,这些模型必须进行零样本操作,在未见过的任务和环境上执行视角合成。我们在一个我们称为视角合成增强(VISTA)的简单数据增强方案中实证分析了视角合成模型,以了解它们从单视角演示数据中学习视角不变策略的能力。在评估用我们的方法训练的策略对分布外相机视角的鲁棒性时,我们发现它们在模拟和真实世界操作任务中均优于基线。视频和额外的可视化结果可在 https://s-tian.github.io/projects/vista 获取。
引用
@article{arxiv.2409.03685,
title = {View-Invariant Policy Learning via Zero-Shot Novel View Synthesis},
author = {Stephen Tian and Blake Wulfe and Kyle Sargent and Katherine Liu and Sergey Zakharov and Vitor Guizilini and Jiajun Wu},
journal= {arXiv preprint arXiv:2409.03685},
year = {2025}
}
备注
Accepted to CoRL 2024