通过伪动作利用动作重复中被跳过的帧
机器学习
2021-05-10 v1 人工智能
摘要
在许多深度强化学习设定中,当智能体执行一个动作时,它会在预定义的次数内重复同一动作,且直到下一个动作决策点之前不观测状态。这种动作重复技术在训练智能体时有若干优点,但动作决策点之间的数据(即中间帧)实际上被丢弃了。由于训练数据量与动作重复的间隔成反比,它们会对训练的样本效率产生负面影响。本文中,我们提出一种简单而有效的方法,通过引入伪动作的概念来缓解这一问题。我们方法的核心思想是通过考虑伪动作,使动作决策点之间的转移可用作训练数据。连续控制任务的伪动作取为跨越动作决策点的动作序列的平均值。对于离散控制任务,伪动作由学习到的动作嵌入计算得到。该方法可与任何涉及 Q 函数学习的无模型强化学习算法结合。我们在 OpenAI Gym 的连续与离散控制任务上展示了我们方法的有效性。
引用
@article{arxiv.2105.03041,
title = {Utilizing Skipped Frames in Action Repeats via Pseudo-Actions},
author = {Taisei Hashimoto and Yoshimasa Tsuruoka},
journal= {arXiv preprint arXiv:2105.03041},
year = {2021}
}
备注
Deep Reinforcement Learning Workshop, NeurIPS 2020