中文

基于核范数最大化的好奇心驱动学习

机器学习 2022-05-31 v2 人工智能

摘要

为处理强化学习中外部奖励的稀疏性,研究者提出了内在奖励,使智能体能够学习可能在未来有助于获取奖励的技能,例如鼓励智能体访问新颖状态。然而,由于环境不可避免的随机性,内在奖励可能存在噪声,直接将带噪声的值预测用于监督策略会损害学习性能与效率。此外,许多先前研究采用 2\ell^2 范数或方差来衡量探索新颖性,平方操作会放大噪声。本文中,我们通过提出一种利用核范数最大化(NNM)的新颖好奇心机制来应对上述挑战,该机制能更准确地量化探索环境的新颖性,同时对噪声和离群点具有高容忍度。我们在多种基准环境上进行了广泛实验,结果表明与以往好奇心方法相比,NNM能取得最先进的性能。在26个Atari游戏子集上,仅用内在奖励训练时,NNM取得1.09的人类归一化得分,是基于竞争内在奖励方法的两倍。我们的代码将公开发布以增强可复现性。

关键词

引用

@article{arxiv.2205.10484,
  title  = {Nuclear Norm Maximization Based Curiosity-Driven Learning},
  author = {Chao Chen and Zijian Gao and Kele Xu and Sen Yang and Yiying Li and Bo Ding and Dawei Feng and Huaimin Wang},
  journal= {arXiv preprint arXiv:2205.10484},
  year   = {2022}
}