中文

强化学习中的内在动机自监督学习

机器学习 2022-05-16 v2 人工智能

摘要

在基于视觉的强化学习(RL)任务中,通常会分配带有代理自监督损失的辅助任务,以获得更具语义的表示并提升样本效率。然而,由于表示学习部分与决策部分相分离,自监督辅助任务中的丰富信息被忽视了。为充分利用辅助任务中的信息,我们提出一个简单而有效的思路,将自监督损失用作内在奖励,称为强化学习中的内在动机自监督学习(IM-SSR)。我们形式化地表明,自监督损失可分解为针对新状态的探索以及通过消除干扰实现的鲁棒性提升。IM-SSR几乎无需额外代价即可轻松插入任何带有自监督辅助目标的强化学习中。结合IM-SSR后,此前的底层算法在DeepMind Control Suite的多种基于视觉的机器人任务中,于样本效率与泛化能力上均取得显著提升,尤其在奖励信号稀疏时。

关键词

引用

@article{arxiv.2106.13970,
  title  = {Intrinsically Motivated Self-supervised Learning in Reinforcement Learning},
  author = {Yue Zhao and Chenzhuang Du and Hang Zhao and Tiejun Li},
  journal= {arXiv preprint arXiv:2106.13970},
  year   = {2022}
}