中文

重访深度强化学习中的数据增强

机器学习 2024-02-20 v1 人工智能 计算机视觉与模式识别

摘要

近年来,基于图像的深度强化学习(DRL)中提出了各种数据增强技术。尽管它们在经验上证明了数据增强对于提高样本效率或泛化能力的有效性,但究竟应优先选择哪种技术尚不明确。为解决这一问题,我们分析了现有方法以更好地理解它们并揭示其相互联系。值得注意的是,通过表达这些方法的 Q 目标方差以及经验演员/评论家(actor/critic)损失的方差,我们可以分析其不同组件的效果并进行比较。此外,我们 formulate 了一种解释,说明在计算目标 Q 值时选择不同数据增强变换如何影响这些方法。该分析提出了如何以更原则性的方式利用数据增强的建议。另外,我们引入了一个称为 tangent prop 的正则化项,该项此前已在计算机视觉中提出,但据我们所知,将其适配至 DRL 尚属首次。我们在多个领域评估了我们的提议并验证了我们的分析。与不同的相关基线相比,我们证明该方法在大多数环境中实现了最先进(SOTA)的性能,并在一些复杂环境中展现出更高的样本效率和更好的泛化能力。

关键词

引用

@article{arxiv.2402.12181,
  title  = {Revisiting Data Augmentation in Deep Reinforcement Learning},
  author = {Jianshu Hu and Yunpeng Jiang and Paul Weng},
  journal= {arXiv preprint arXiv:2402.12181},
  year   = {2024}
}

备注

Accepted in ICLR 2024