面向机器人操作的视觉强化学习中的视图融合与解耦
机器学习
2025-09-01 v2 计算机视觉与模式识别
机器人学
摘要
视觉在操作任务中的应用广为人知,尤其是在视觉伺服中。由于世界的三维特性,使用多个相机视角并将其融合可以为Q学习创建更好的表示,进而训练出样本效率更高的策略。然而,这些多视角策略对相机故障敏感,且部署起来可能较为繁琐。为了缓解这些问题,我们引入了一种融合与解耦(MAD)算法,该算法能高效地融合视角以提高样本效率,同时通过用单视角特征增强多视角特征输入来解耦视角。这产生了鲁棒的策略,并允许轻量级部署。我们使用Meta-World和ManiSkill3展示了我们方法的效率和鲁棒性。项目网站和代码见 https://aalmuzairee.github.io/mad。
引用
@article{arxiv.2505.04619,
title = {Merging and Disentangling Views in Visual Reinforcement Learning for Robotic Manipulation},
author = {Abdulaziz Almuzairee and Rohan Patil and Dwait Bhatt and Henrik I. Christensen},
journal= {arXiv preprint arXiv:2505.04619},
year = {2025}
}
备注
Accepted at CoRL 2025. For project website and code, see https://aalmuzairee.github.io/mad