内在奖励对强化学习中探索的影响
人工智能
2025-01-22 v1 机器学习
摘要
强化学习中的稀疏奖励环境探索困难是一大开放挑战。已提出 various 类型的内在奖励以通过推动多样性来解决此挑战。这种多样性可能以不同层次实现,偏好智能体探索不同的状态、策略或行为(分别为状态、策略和技能层面的多样性)。然而,多样性对智能体行为的影响仍不明确。本文旨在通过研究由内在奖励施加的不同层次多样性对 RL 智能体探索模式的影响来填补这一空白。我们选取四种内在奖励(状态计数、内在好奇心模块(ICM)、最大熵和 多样性就是你需要的(DIAYN)),每种都针对不同的多样性层次。我们在 MiniGrid 环境中进行经验研究,比较它们对探索的影响,包括:剧集回报、观察覆盖率、智能体位置覆盖率、策略熵以及到达稀疏奖励所需的时间。研究的主要结果表明,在低维观察的情况下,状态计数导致最佳的探索性能。然而,在 RGB 观察的情况下,状态计数的性能大幅下降,主要由于表征学习挑战。相反,最大熵对此影响较小,导致更稳健的探索,尽管并非总是最优。最后,我们的经验研究揭示了通过 DIAYN 学习多样化技能(通常与改进的鲁棒性和泛化性相关联)并不促进 MiniGrid 环境中的探索。这是因为:i) 学习技能空间本身可能具有挑战性,ii) 在技能空间中的探索优先于区分行为,而非实现均匀的状态访问。
引用
@article{arxiv.2501.11533,
title = {The impact of intrinsic rewards on exploration in Reinforcement Learning},
author = {Aya Kayal and Eduardo Pignatelli and Laura Toni},
journal= {arXiv preprint arXiv:2501.11533},
year = {2025}
}
备注
45 pages, 17 figures. Submitted to Neural Computing and Applications Journal