理解动力学不变数据增强何时有益于无模型强化学习更新
机器学习
2024-03-19 v2
摘要
近来,数据增强(DA)已成为一种在强化学习(RL)任务中利用领域知识廉价生成额外数据的方法,常带来数据效率的显著提升。尽管先前工作已证明将增强数据直接纳入无模型 RL 更新的效用,但特定 DA 策略何时能改善数据效率尚不清晰。本文旨在识别 DA 中导致观测到学习提升的一般因素。我们的研究聚焦于具有动力学不变数据增强函数的稀疏奖励任务,作为通向更一般理解 DA 及其与 RL 训练整合的初步步骤。实验中,我们分离出 DA 的三个相关方面:状态-动作覆盖、奖励密度,以及每次更新生成的增强转移数(增强重放比)。从实验中我们得出两点结论:(1)增加状态-动作覆盖对数据效率的影响往往远大于增加奖励密度;(2)降低增强重放比可大幅提升数据效率。事实上,我们实证研究中某些任务仅在重放比足够低时才可解。
引用
@article{arxiv.2310.17786,
title = {Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates},
author = {Nicholas E. Corrado and Josiah P. Hanna},
journal= {arXiv preprint arXiv:2310.17786},
year = {2024}
}
备注
ICLR 2024