面向离线强化学习泛化的等变数据增强
机器学习
2023-09-15 v1 人工智能
机器人学
摘要
我们提出了一种新方法,以解决离线强化学习(RL)中的泛化挑战,其中智能体从固定数据集中学习,而不与环境进行任何额外交互。具体而言,我们旨在提升智能体对分布外目标的泛化能力。为此,我们提出学习一个动力学模型,并检查其相对于一类固定变换(即状态空间中的平移)是否具有等变性。然后,我们使用熵正则化器来扩大等变集合,并用所得变换后的样本增强数据集。最后,我们基于增强后的数据集,使用现成的离线RL算法离线学习一个新策略。我们的实验结果表明,我们的方法能大幅提升策略在所考虑环境中的测试性能。
引用
@article{arxiv.2309.07578,
title = {Equivariant Data Augmentation for Generalization in Offline Reinforcement Learning},
author = {Cristina Pinneri and Sarah Bechtle and Markus Wulfmeier and Arunkumar Byravan and Jingwei Zhang and William F. Whitney and Martin Riedmiller},
journal= {arXiv preprint arXiv:2309.07578},
year = {2023}
}