Tesseract:面向多智能体强化学习的张量化执行体
机器学习
2021-06-02 v1
摘要
大动作空间中的强化学习是一个具有挑战性的问题。协作式多智能体强化学习(MARL)通过施加各类通信与可观测性约束使问题更为棘手。本文中,我们考虑影响基于值与策略梯度方法的根本障碍:动作空间随智能体数量呈指数级膨胀。对于基于值的方法,这给精确表示最优值函数带来挑战;对于策略梯度方法,它使评论家(critic)的训练困难并加剧了滞后评论家问题。我们表明,从学习理论视角看,这两个问题均可通过以低复杂度假设类精确表示相应的动作值函数来解决,这要求以样本高效的方式精确建模智能体交互。为此,我们提出了贝尔曼方程的新型张量化形式。由此诞生了我们的方法 Tesseract,其将 Q 函数视为一个张量,各模态对应于不同智能体的动作空间。由 Tesseract 衍生的算法跨智能体分解 Q 张量,并利用低秩张量近似来建模与任务相关的智能体交互。我们给出了基于 Tesseract 算法的 PAC 分析,并阐明了其与富观测 MDP 类的关联。不同领域的实证结果证实了 Tesseract 在理论所预测的样本效率上的提升。
引用
@article{arxiv.2106.00136,
title = {Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning},
author = {Anuj Mahajan and Mikayel Samvelyan and Lei Mao and Viktor Makoviychuk and Animesh Garg and Jean Kossaifi and Shimon Whiteson and Yuke Zhu and Animashree Anandkumar},
journal= {arXiv preprint arXiv:2106.00136},
year = {2021}
}
备注
38th International Conference on Machine Learning, PMLR 139, 2021