离线强化学习的双重温和泛化
机器学习
2024-11-14 v2 人工智能
摘要
离线强化学习(RL)面临外推误差和值高估问题。从泛化的角度来看,这个问题可以归因于价值函数或策略对分布外(OOD)动作的过度泛化。已有大量努力致力于减轻这种泛化,并且最近的样本内学习方法进一步成功地完全避免了它。然而,我们表明,在特定条件下,超出数据集的温和泛化是可以信赖并利用来提高性能的。为了在离线RL中恰当地利用泛化,我们提出了双重温和泛化(DMG),它包括(i)温和动作泛化和(ii)温和泛化传播。前者指的是在数据集的邻近区域选择动作以最大化Q值。即便如此,潜在的错误泛化仍然可以通过自举法传播、累积和加剧。鉴于此,我们引入了后一个概念,以在不阻碍RL学习信号传播的情况下减轻泛化传播。理论上,DMG在理想泛化场景下保证了比样本内最优策略更好的性能。即使在最坏情况的泛化下,DMG仍然可以将值高估控制在特定水平,并保证性能的下界。在经验上,DMG在Gym-MuJoCo运动任务和具有挑战性的AntMaze任务中均达到了最先进的性能。此外,得益于其在两个泛化方面的灵活性,DMG能够无缝地从离线学习过渡到在线学习,并获得了强大的在线微调性能。
引用
@article{arxiv.2411.07934,
title = {Doubly Mild Generalization for Offline Reinforcement Learning},
author = {Yixiu Mao and Qi Wang and Yun Qu and Yuhang Jiang and Xiangyang Ji},
journal= {arXiv preprint arXiv:2411.07934},
year = {2024}
}
备注
Accepted to NeurIPS 2024