MAN:多动作网络学习
机器学习
2023-03-02 v2 人工智能
摘要
在强化学习领域,由于当前探索效率低下,学习具有大型离散动作空间的控制策略是一个具有挑战性的问题。在高维动作空间中,每个单独维度上都有大量潜在动作需要学习策略。在这项工作中,我们提出了一种称为多动作网络(Multi-Action Networks, MAN)学习的深度强化学习(DRL)算法,以应对高维大型离散动作空间的挑战。我们建议将 N 维动作空间分解为 N 个一维分量,称为子动作,并为每个子动作创建一个价值神经网络。然后,MAN 使用时序差分学习同步训练这些网络,这比直接训练具有大型动作输出的单一网络更简单。为了评估所提出的方法,我们在三种场景上测试了 MAN:一个 n 维迷宫任务、一个积木堆叠任务,并将 MAN 扩展到处理来自 Atari Arcade Learning 环境的 12 个具有 18 个动作空间的游戏。我们的结果表明,MAN 比 Deep Q-Learning 和 Double Deep Q-Learning 学习得更快,这意味着我们的方法是比当前可用于大型离散动作空间的算法性能更好的同步时序差分算法。
引用
@article{arxiv.2209.09329,
title = {MAN: Multi-Action Networks Learning},
author = {Keqin Wang and Alison Bartsch and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2209.09329},
year = {2023}
}