探索-前进:利用探索提升深度强化学习中的泛化能力
机器学习
2024-09-19 v3 人工智能
摘要
强化学习中一个剩余的挑战是开发出能够对一旦部署后可能遇到的新情景进行泛化的智能体。这个挑战常被建模为多任务场景,其中智能体训练于固定的任务集合,却需要泛化到新任务。最近的研究表明,在这一场景下,增加训练期间的探索行为可以被用来提升智能体的泛化性能。这在测试期间遇到的状态实际上可以在训练期间被探索时尤为合理。本文提供直观解释,说明探索为何也能帮助泛化到训练期间无法显式遇到的状态。此外,我们提出了一种新方法Explore-Go,通过增加智能体训练的状态数量来利用这一直观。Explore-Go实际上有效地增加了智能体的起始状态分布,因而可与大多数现有的基于策略或基于离策略的强化学习算法联合使用。我们在一个说明性环境中以及在Procgen基准测试上,实证表明该方法能够提高泛化性能。
引用
@article{arxiv.2406.08069,
title = {Explore-Go: Leveraging Exploration for Generalisation in Deep Reinforcement Learning},
author = {Max Weltevrede and Felix Kaubek and Matthijs T. J. Spaan and Wendelin Böhmer},
journal= {arXiv preprint arXiv:2406.08069},
year = {2024}
}