中文

多视角解缠:面向多相机强化学习

机器学习 2024-06-24 v2 计算机视觉与模式识别

摘要

基于图像的强化学习(RL)智能体的性能可能因用于捕获图像的相机位置而异。同时使用多个相机(包括第一人称自我中心相机)进行训练,可以利用不同相机视角的信息来提高RL的性能。然而,硬件限制可能限制在现实部署中多个相机的可用性。此外,相机可能在现实世界中损坏,从而无法访问训练期间使用的所有相机。为了克服这些硬件限制,我们提出了多视角解缠(MVD),它使用多个相机来学习一个对相机数量减少具有鲁棒性的策略,从而泛化到训练集中的任何单个相机。我们的方法是RL的一种自监督辅助任务,它从多个相机学习解缠表示,其中跨所有相机对齐的共享表示允许泛化到单个相机,以及特定于相机的私有表示。我们通过实验表明,仅使用单个第三人称相机训练的RL智能体在许多控制任务中无法学习最优策略;但是,我们的方法在训练期间受益于多个相机,能够仅使用相同的单个第三人称相机解决该任务。

关键词

引用

@article{arxiv.2404.14064,
  title  = {Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras},
  author = {Mhairi Dunion and Stefano V. Albrecht},
  journal= {arXiv preprint arXiv:2404.14064},
  year   = {2024}
}

备注

Reinforcement Learning Conference (RLC), 2024