中文

MaDi:学习掩蔽干扰以实现视觉深度强化学习的泛化

机器学习 2023-12-27 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

视觉世界提供了丰富的信息,但智能体接收到的许多输入像素通常包含干扰刺激。自主智能体需要能够区分有用信息和任务无关的感知,从而泛化到具有新干扰的未见环境。现有工作使用数据增强或带有额外损失函数的大型辅助网络来处理这一问题。我们引入了MaDi,一种新颖的算法,仅通过奖励信号学习掩蔽干扰。在MaDi中,深度强化学习智能体的传统actor-critic结构由一个小的第三兄弟——Masker——补充。这个轻量级神经网络生成一个掩码,决定actor和critic将接收什么,从而使它们能够专注于学习任务。掩码根据当前输入动态创建。我们在DeepMind Control泛化基准、Distracting Control Suite和真实的UR5机械臂上进行了实验。我们的算法通过有用的掩码改善了智能体的专注度,而其高效的Masker网络仅向原始结构增加了0.2%的参数,这与先前的工作形成对比。MaDi始终取得优于或与最先进方法相当的泛化结果。

关键词

引用

@article{arxiv.2312.15339,
  title  = {MaDi: Learning to Mask Distractions for Generalization in Visual Deep Reinforcement Learning},
  author = {Bram Grooten and Tristan Tomilin and Gautham Vasan and Matthew E. Taylor and A. Rupam Mahmood and Meng Fang and Mykola Pechenizkiy and Decebal Constantin Mocanu},
  journal= {arXiv preprint arXiv:2312.15339},
  year   = {2023}
}

备注

Accepted as full-paper (oral) at AAMAS 2024. Code is available at https://github.com/bramgrooten/mask-distractions and see our 40-second video at https://youtu.be/2oImF0h1k48