中文

LECO:用于任务特定内在奖励的可学习情景计数

机器学习 2022-10-12 v1 人工智能

摘要

情景计数被广泛用于为稀疏奖励下的强化学习设计简单而有效的内在动机。然而,在高维状态空间以及长情景时间下使用情景计数需要彻底的状态压缩和快速哈希,这阻碍了在此类困难且复杂的探索环境中对其进行严格利用。此外,情景计数中任务无关观测的干扰可能导致其内在动机忽略与任务相关的状态重要变化,而以情景方式呈现的新颖性可能导致跨情景反复访问熟悉的状态。为了解决这些问题,本文提出了一种基于可学习哈希的情景计数,我们将其命名为 LECO,它在困难探索问题中有效地作为任务特定的内在奖励。具体而言,所提出的内在奖励由情景新颖性和任务特定调制组成,其中前者采用向量量化变分自编码器自动获取离散状态码以实现快速计数,而后者通过学习调制器来优化任务特定的外在奖励以调节情景新颖性。所提出的 LECO 特别能够在强化学习期间实现从探索到利用的自动过渡。我们通过实验表明,与以往的探索方法相比,LECO 成功解决了困难探索问题,并通过 MiniGrid 和 DMLab 环境中最困难的任务扩展到了大型状态空间。

关键词

引用

@article{arxiv.2210.05409,
  title  = {LECO: Learnable Episodic Count for Task-Specific Intrinsic Reward},
  author = {Daejin Jo and Sungwoong Kim and Daniel Wontae Nam and Taehwan Kwon and Seungeun Rho and Jongmin Kim and Donghoon Lee},
  journal= {arXiv preprint arXiv:2210.05409},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022