理解什么影响视觉强化学习中的泛化差距:理论与经验证据
机器学习
2024-10-17 v2 人工智能
机器学习
摘要
最近,有许多工作试图学习视觉强化学习(RL)中连续控制的有用策略。在这种情况下,学习一个可泛化的策略很重要,因为测试环境可能与训练环境不同,例如,部署期间存在干扰物。许多实用算法被提出来处理这个问题。然而,据我们所知,没有一种算法提供关于什么影响泛化差距以及为什么它们提出的方法有效的理论理解。在本文中,我们通过理论回答当测试环境存在干扰物时导致泛化差距的关键因素来弥补这一问题。我们的理论表明,最小化训练和测试环境之间的表示距离(这与人类直觉一致)对于减少泛化差距最为关键。我们的理论结果得到了DMControl泛化基准(DMC-GB)中经验证据的支持。
引用
@article{arxiv.2402.02701,
title = {Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence},
author = {Jiafei Lyu and Le Wan and Xiu Li and Zongqing Lu},
journal= {arXiv preprint arXiv:2402.02701},
year = {2024}
}
备注
Accepted by Journal of Artificial Intelligence Research (JAIR)