面向数据高效强化学习的时间一致表示学习
机器学习
2021-10-12 v1 人工智能
摘要
存在于高维状态空间(如由图像构成的空间)中的深度强化学习(RL)智能体具有相互关联的学习负担。智能体必须学习完成给定任务的动作选择策略,这要求它们学习能区分有用与无用信息的状态空间表示。奖励函数是RL智能体接收的唯一监督反馈,这导致表示学习瓶颈,表现为样本效率低下。我们提出-Step Latent (KSL),一种通过自监督辅助任务强制表示时间一致性的新方法,其中智能体学习递归预测动作条件的状态空间表示。KSL学习的状态编码器产生低维表示,使RL任务的优化更具样本效率。总体而言,KSL在流行的PlaNet基准套件中于数据效率和渐近性能上均取得最先进结果。我们的分析表明,KSL产生的编码器比训练中未见过的新任务泛化更好,且其表示比其他方法(如DrQ、RAD、CURL和SAC-AE)更强地关联奖励、对状态空间中的扰动更不变、并在RL问题的时间轴上更平滑地移动。
引用
@article{arxiv.2110.04935,
title = {Learning Temporally-Consistent Representations for Data-Efficient Reinforcement Learning},
author = {Trevor McInroe and Lukas Schäfer and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2110.04935},
year = {2021}
}