中文

面向数据高效强化学习的时间一致表示学习

机器学习 2021-10-12 v1 人工智能

摘要

存在于高维状态空间(如由图像构成的空间)中的深度强化学习(RL)智能体具有相互关联的学习负担。智能体必须学习完成给定任务的动作选择策略,这要求它们学习能区分有用与无用信息的状态空间表示。奖励函数是RL智能体接收的唯一监督反馈,这导致表示学习瓶颈,表现为样本效率低下。我们提出kk-Step Latent (KSL),一种通过自监督辅助任务强制表示时间一致性的新方法,其中智能体学习递归预测动作条件的状态空间表示。KSL学习的状态编码器产生低维表示,使RL任务的优化更具样本效率。总体而言,KSL在流行的PlaNet基准套件中于数据效率和渐近性能上均取得最先进结果。我们的分析表明,KSL产生的编码器比训练中未见过的新任务泛化更好,且其表示比其他方法(如DrQ、RAD、CURL和SAC-AE)更强地关联奖励、对状态空间中的扰动更不变、并在RL问题的时间轴上更平滑地移动。

关键词

引用

@article{arxiv.2110.04935,
  title  = {Learning Temporally-Consistent Representations for Data-Efficient Reinforcement Learning},
  author = {Trevor McInroe and Lukas Schäfer and Stefano V. Albrecht},
  journal= {arXiv preprint arXiv:2110.04935},
  year   = {2021}
}