Koopman Q-learning:基于动力学对称性的离线强化学习
机器学习
2022-06-29 v2
摘要
离线强化学习利用大型数据集训练策略,而无需与环境交互。所学习的策略随后可部署于交互代价高昂或危险的真实场景。当前算法对训练数据集过拟合,因此在部署到环境的分布外泛化时表现不佳。我们旨在通过学习 Koopman 潜表示来解决这些局限,该表示使我们能够推断系统底层动力学的对称性。后者随后被用于训练期间扩展原本静态的离线数据集;这构成了一种新颖的数据增强框架,其反映了系统动力学,因而可解释为对环境相空间的探索。为获取对称性,我们采用 Koopman 理论,其中非线性动力学由作用于系统测量函数空间的线性算子表示,从而可直接推断动力学的对称性。我们提供了关于与控制系统的对称性(如强化学习设定)相关的存在性与性质的新理论结果。此外,我们在包括 D4RL、Metaworld 和 Robosuite 在内的若干基准离线强化学习任务与数据集上对所提方法进行了实证评估,发现借助我们的框架可持续提升无模型 Q-learning 方法的最优水平。
引用
@article{arxiv.2111.01365,
title = {Koopman Q-learning: Offline Reinforcement Learning via Symmetries of Dynamics},
author = {Matthias Weissenbacher and Samarth Sinha and Animesh Garg and Yoshinobu Kawahara},
journal= {arXiv preprint arXiv:2111.01365},
year = {2022}
}