中文

注意力特权强化学习

人工智能 2021-01-12 v3 机器学习

摘要

基于图像的强化学习已知存在样本效率低下以及对未见视觉(如干扰物,即观测空间中与任务无关的部分)泛化能力差的问题。视觉域随机化通过在目标域中可能遇到的视觉变化因素上进行训练来鼓励迁移。这增加了学习复杂度,会对学习率和性能产生负面影响,并且需要在部署时了解潜在的变化。在本文中,我们提出注意力特权强化学习(APRiL),其使用自监督注意力机制来显著缓解这些缺陷:通过聚焦于观测中与任务相关的方面,注意力提供了对干扰物的鲁棒性以及显著提升的学习效率。APRiL 训练两个注意力增强的 actor-critic 智能体:一个纯粹基于图像观测,在训练和迁移域中均可用;另一个可访问仅在训练期间可用的特权信息(如环境状态)。经验在这两个智能体之间共享,并且它们的注意力机制被对齐。随后可部署基于图像的策略而无需访问特权信息。我们通过实验在多样化的一组域上展示了加速且更鲁棒的学习,从而为训练分布内和分布外的环境带来了改进的最终性能。

关键词

引用

@article{arxiv.1911.08363,
  title  = {Attention-Privileged Reinforcement Learning},
  author = {Sasha Salter and Dushyant Rao and Markus Wulfmeier and Raia Hadsell and Ingmar Posner},
  journal= {arXiv preprint arXiv:1911.08363},
  year   = {2021}
}

备注

Published at Conference on Robot Learning (CoRL) 2020