多样回放对强化学习泛化能力的作用
机器学习
2023-09-01 v2
摘要
在强化学习(RL)中,许多算法的关键组成部分是探索策略与回放缓冲区。这些策略调控所收集并用于训练的环境数据,已在 RL 文献中被广泛研究。本文中,我们在多任务 RL 泛化的背景下考察这些组件的影响。我们研究如下假设:从训练环境中收集并基于更多样化的数据进行训练,将改善对新任务的零样本泛化。我们从数学上给出动机,并凭经验表明,对于训练期间“可达”的任务,其泛化可通过增加回放缓冲区中转移样本的多样性而得到改善。此外,我们凭经验表明,同一策略对于相似但“不可达”任务的泛化也有提升,这可能是由于所学潜在表征的泛化能力增强所致。
引用
@article{arxiv.2306.05727,
title = {The Role of Diverse Replay for Generalisation in Reinforcement Learning},
author = {Max Weltevrede and Matthijs T. J. Spaan and Wendelin Böhmer},
journal= {arXiv preprint arXiv:2306.05727},
year = {2023}
}
备注
15 pages, 8 figures