面向多智能体强化学习的异步 Actor-Critic 方法
机器学习
2022-10-12 v2 人工智能
多智能体系统
机器人学
摘要
在真实环境中跨多个智能体同步决策存在困难,因为这要求智能体等待其他智能体终止并可靠地就终止进行通信。理想情况下,智能体应当改为异步地学习与执行。此类异步方法还允许基于情境与所执行动作而耗时不同的时间扩展动作。遗憾的是,当前的策略梯度方法不适用于异步环境,因为它们假设智能体在每个时间步同步地进行动作选择推理。为支持异步学习与决策,我们提出一组异步多智能体 actor-critic 方法,使智能体能够在三种标准训练范式下直接优化异步策略:去中心化学习、集中式学习,以及用于去中心化执行的集中式训练。在多种真实领域(仿真与硬件)中的实证结果表明,我们的方法在大型多智能体问题中具有优越性,并验证了我们所提算法在学习高质量异步解方面的有效性。
引用
@article{arxiv.2209.10113,
title = {Asynchronous Actor-Critic for Multi-Agent Reinforcement Learning},
author = {Yuchen Xiao and Weihao Tan and Christopher Amato},
journal= {arXiv preprint arXiv:2209.10113},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2209.10003