面向困难探索环境的强化学习中内在动机技术评估研究
机器学习
2022-11-22 v2 人工智能
摘要
近年来,围绕稀疏奖励环境下 formulated 的强化学习任务的研究活动尤为显著。在应对这些困难探索问题的众多方法中,内在动机机制可以说是迄今为止研究最多的替代方案之一。该领域随时间推进的进展通过提出新的算法思想以生成衡量新颖性的替代机制来解决探索问题。然而,此方向上的多数努力忽视了不同设计选择与参数设置的影响——这些同样被引入以提升所生成内在奖励效果的因素,却被遗忘应用于其他也可能从中受益的内在动机技术。此外,某些内在方法使用不同的基础强化算法(如 PPO、IMPALA)与神经网络架构,使得公平比较各方案所提供的结果与实际进展十分困难。本工作的目标是强调这一在困难探索环境强化学习中的关键问题,揭示前沿内在动机技术对不同设计因素的变异性与敏感性。最终,我们本文报告的实验强调了在相同设置下,根据环境探索需求与具体任务仔细选择这些设计方面的重要性,以保障公平比较。
引用
@article{arxiv.2205.11184,
title = {An Evaluation Study of Intrinsic Motivation Techniques applied to Reinforcement Learning over Hard Exploration Environments},
author = {Alain Andres and Esther Villar-Rodriguez and Javier Del Ser},
journal= {arXiv preprint arXiv:2205.11184},
year = {2022}
}
备注
21 pages, 5 figures, 5 tables