在数据高效强化学习中利用视角一致动力学加速表征学习
机器学习
2022-01-19 v1 人工智能
摘要
从基于图像的观测中学习信息丰富的表征是深度强化学习(RL)的基本问题。然而,数据低效仍是实现该目标的重大障碍。为克服此障碍,我们提出通过对动力学施加视角一致性来加速状态表征学习。首先,我们引入多视角马尔可夫决策过程(MMDP)的形式化框架,其包含状态的多个视角。遵循 MMDP 结构,我们的方法视角一致动力学(VCD)通过在潜空间训练视角一致动力学模型来学习状态表征,其中视角通过对状态施加数据增强生成。在 DeepMind Control Suite 与 Atari-100k 上的实证评估表明,VCD 是视觉控制任务上 SOTA 的数据高效算法。
引用
@article{arxiv.2201.07016,
title = {Accelerating Representation Learning with View-Consistent Dynamics in Data-Efficient Reinforcement Learning},
author = {Tao Huang and Jiachen Wang and Xiao Chen},
journal= {arXiv preprint arXiv:2201.07016},
year = {2022}
}