仅靠探索就够了吗?强化学习迁移中的有效探索特征
机器学习
2024-04-04 v1 人工智能
摘要
在深度强化学习(RL)研究中,人们一直致力于设计更高效、多产的探索方法来解决稀疏奖励问题。这些探索方法通常共享共同的原则(例如,提高多样性)和实现细节(例如,内在奖励)。先前的工作发现,非平稳马尔可夫决策过程(MDPs)需要通过探索来在线迁移学习中高效适应环境的变化。然而,深度 RL 中特定探索特征与有效迁移学习之间的关系尚未得到刻画。在这项工作中,我们试图理解显著探索特征与迁移学习中改善的性能和效率之间的关系。我们在多种迁移类型——或“新颖性”——上测试了十一种流行的探索算法,以识别对在线迁移学习产生积极影响的特征。我们的分析表明,一些特征在广泛的迁移任务中与改善的性能和效率相关,而另一些特征仅针对特定的环境变化改善迁移性能。基于我们的分析,我们针对哪些探索算法特征最适合特定的迁移情况提出了建议。
引用
@article{arxiv.2404.02235,
title = {Is Exploration All You Need? Effective Exploration Characteristics for Transfer in Reinforcement Learning},
author = {Jonathan C. Balloch and Rishav Bhagat and Geigh Zollicoffer and Ruoran Jia and Julia Kim and Mark O. Riedl},
journal= {arXiv preprint arXiv:2404.02235},
year = {2024}
}