基于优先级与多样性的自模仿强化学习在稀疏奖励程序化环境中的增强泛化
机器学习
2023-11-02 v1 人工智能
摘要
探索是稀疏奖励下强化学习(RL)的一个基本挑战,由于缺乏信息性反馈信号,限制了智能体学习最优决策的能力。自模仿学习(self-IL)已成为一种有前景的探索方法,利用回放缓冲存储并复现成功行为。然而,依赖高回报转移并假设单一环境的传统self-IL方法在泛化上面临挑战,尤其在程序化生成(PCG)环境中。因此,已有新的self-IL方法被提出以对持久化经验进行排序,但它们均匀回放转移而不论其重要性,且未解决所存储演示的多样性。本工作中,我们提出定制化的self-IL采样策略,以不同方式对转移进行优先级排序,并将优先级技术扩展至PCG环境。我们还通过对抗泛化需求与优先级技术引入偏差的影响之修改来解决多样性损失。我们在包括MiniGrid和ProcGen在内的三个PCG稀疏奖励环境上进行的实验分析,凸显了所提修改的优势,在MiniGrid-MultiRoom-N12-S10环境中取得了新的SOTA性能。
引用
@article{arxiv.2311.00426,
title = {Enhanced Generalization through Prioritization and Diversity in Self-Imitation Reinforcement Learning over Procedural Environments with Sparse Rewards},
author = {Alain Andres and Daochen Zha and Javier Del Ser},
journal= {arXiv preprint arXiv:2311.00426},
year = {2023}
}
备注
7 pages, 5 figures