中文

多样回放对强化学习泛化能力的作用

机器学习 2023-09-01 v2

摘要

在强化学习(RL)中,许多算法的关键组成部分是探索策略与回放缓冲区。这些策略调控所收集并用于训练的环境数据,已在 RL 文献中被广泛研究。本文中,我们在多任务 RL 泛化的背景下考察这些组件的影响。我们研究如下假设:从训练环境中收集并基于更多样化的数据进行训练,将改善对新任务的零样本泛化。我们从数学上给出动机,并凭经验表明,对于训练期间“可达”的任务,其泛化可通过增加回放缓冲区中转移样本的多样性而得到改善。此外,我们凭经验表明,同一策略对于相似但“不可达”任务的泛化也有提升,这可能是由于所学潜在表征的泛化能力增强所致。

关键词

引用

@article{arxiv.2306.05727,
  title  = {The Role of Diverse Replay for Generalisation in Reinforcement Learning},
  author = {Max Weltevrede and Matthijs T. J. Spaan and Wendelin Böhmer},
  journal= {arXiv preprint arXiv:2306.05727},
  year   = {2023}
}

备注

15 pages, 8 figures