学习策略子空间用于强化学习中的在线适应
机器学习
2022-10-25 v3 人工智能
摘要
深度强化学习(RL)主要在训练与测试环境相似的环境下被研究。但在许多实际应用中,这些环境可能不同。例如,在控制系统中,学习策略所基于的机器人可能与运行策略的机器人不同。这可由不同的内部因素(如校准问题、系统损耗、缺陷模块)或外部变化(如天气条件)引起。有必要开发对训练条件变化泛化良好的 RL 方法。在本文中,我们考虑最简单却难以应对的泛化设定:测试环境在训练时未知,迫使智能体适应系统的新动态。该在线适应过程可能在计算上开销大(如微调),且无法依赖元 RL 技术,因为仅有一个训练环境。为此,我们提出一种在参数空间内学习策略子空间的方法。该子空间包含无限多个策略,它们被训练以求解训练环境,同时具有不同参数值。因此,该子空间中的两个策略以不同方式处理信息,并在面对训练环境变化时表现出不同行为。我们在大量基准上进行的实验将我们的方法与基线(包括基于多样性的方法)进行比较。相比之下,我们的方法易于调参,不需要任何额外组件(如判别器),并学习到能够在未见环境上获取高奖励的策略。
引用
@article{arxiv.2110.05169,
title = {Learning a subspace of policies for online adaptation in Reinforcement Learning},
author = {Jean-Baptiste Gaya and Laure Soulier and Ludovic Denoyer},
journal= {arXiv preprint arXiv:2110.05169},
year = {2022}
}