M2CURL:通过自监督表示学习实现机器人操作的高样本效率多模态强化学习
机器人学
2024-06-21 v2 计算机视觉与模式识别
机器学习
摘要
多模态强化学习(RL)最关键的方面之一是有效整合不同的观测模态。从这些模态中获得鲁棒且准确的表示是增强RL算法鲁棒性和样本效率的关键。然而,在RL环境中为视觉-触觉数据学习表示面临重大挑战,特别是由于数据的高维性以及将视觉和触觉输入与动态环境和任务目标相关联的复杂性。为应对这些挑战,我们提出了多模态对比无监督强化学习(M2CURL)。我们的方法采用一种新颖的多模态自监督学习技术,能够学习高效的表示,并有助于加快RL算法的收敛速度。我们的方法不依赖于特定的RL算法,因此能够与任何现有的RL算法集成。我们在Tactile Gym 2模拟器上评估了M2CURL,并证明它显著提高了不同操作任务中的学习效率。这体现在与未采用我们表示学习方法的基线RL算法相比,收敛速度更快,每个回合的累积奖励更高。
引用
@article{arxiv.2401.17032,
title = {M2CURL: Sample-Efficient Multimodal Reinforcement Learning via Self-Supervised Representation Learning for Robotic Manipulation},
author = {Fotios Lygerakis and Vedant Dave and Elmar Rueckert},
journal= {arXiv preprint arXiv:2401.17032},
year = {2024}
}
备注
Project website: https://sites.google.com/view/M2CURL/home