中文

用于感知强化学习的差分编码观测空间

机器人学 2023-10-04 v1 人工智能

摘要

感知深度强化学习(DRL)近期在利用基于图像的输入数据的复杂 AI 系统中取得了诸多突破。这些成果的应用范围从超人类水平的视频游戏智能体到灵巧且具有物理智能的机器人。然而,训练这些感知 DRL 系统仍极其消耗计算和内存,通常需要庞大的训练数据集和大型经验回放缓冲区。这对下一代现场机器人提出了挑战,它们需要能够在边缘端学习以适应环境。本文中,我们通过差分编码观测空间开始解决这一问题。通过将存储的基于图像的观测重新解释为视频,我们利用无损差分视频编码方案来压缩回放缓冲区而不影响训练性能。我们使用三种最先进的 DRL 算法评估了我们的方法,发现差分图像编码在 Atari 2600 基准和 DeepMind Control Suite(DMC)的任务中分别将内存占用减少了多达 14.2 倍和 16.7 倍。这些节省还使此前需要在闪存与 RAM 之间分页的大规模感知 DRL 能够完全在 RAM 中运行,将 DMC 任务的延迟最多降低 32%。

关键词

引用

@article{arxiv.2310.01767,
  title  = {Differentially Encoded Observation Spaces for Perceptive Reinforcement Learning},
  author = {Lev Grossman and Brian Plancher},
  journal= {arXiv preprint arXiv:2310.01767},
  year   = {2023}
}

备注

7 pages, 4 figures, 2 tables