通过多时间尺度学习解决去中心化协作多智能体深度强化学习中的非平稳性问题
机器学习
2023-08-21 v2
摘要
去中心化协作多智能体深度强化学习(MARL)可以作为一种通用的学习框架,特别是在集中式训练不可行或不切实际的场景中。去中心化深度 MARL 中的一个关键挑战是,当多个智能体同时学习时,学习环境具有非平稳性。独立学习是去中心化 MARL 中一种常用且高效的方案,其中智能体彼此独立地同时更新各自的策略。我们首先表明,独立学习并不总是收敛的,而按序列依次更新策略的序列学习则保证收敛到逐智能体最优解。在序列学习中,当一个智能体更新其策略时,所有其他智能体的策略保持固定,从而缓解了由其他智能体策略同时更新引起的非平稳性挑战。然而,由于在任何时候只有一个智能体在学习,这种方法可能较慢,因此也可能并不总是实用的。在本研究中,我们提出了一种基于多时间尺度学习的去中心化协作 MARL 算法。在多时间尺度学习中,所有智能体同时学习,但具有不同的学习率。在我们提出的方法中,当一个智能体更新其策略时,允许其他智能体也更新其策略,但以较慢的速率进行。这加速了序列学习,同时也最小化了由其他智能体并发更新引起的非平稳性。在 epymarl(Papoudakis 等,2020)基准测试中,多时间尺度学习在一组具有挑战性的多智能体协作任务上优于最先进的去中心化学习方法。这可以看作是朝着基于多时间尺度学习的更通用的去中心化协作深度 MARL 方法迈出的第一步。
引用
@article{arxiv.2302.02792,
title = {Dealing With Non-stationarity in Decentralized Cooperative Multi-Agent Deep Reinforcement Learning via Multi-Timescale Learning},
author = {Hadi Nekoei and Akilesh Badrinaaraayanan and Amit Sinha and Mohammad Amini and Janarthanan Rajendran and Aditya Mahajan and Sarath Chandar},
journal= {arXiv preprint arXiv:2302.02792},
year = {2023}
}