利用离线多智能体强化学习中的结构:低互动秩的优势
机器学习
2024-10-03 v1
摘要
我们研究了在离线多智能体强化学习(MARL)设置中学习近似均衡的问题。我们引入了一种结构性假设——互动秩(interaction rank),并证明了具有低互动秩的函数在分布迁移方面显著比一般情况更稳健。利用这一观察,我们展示了当结合正则化和无损学习时,利用低互动秩的函数类,即可在离线 MARL 中实现去中心化、计算和统计上高效的学习。我们的理论结果以实验为补充,展示了在离线 MARL 中,具有低互动秩的批评架构的潜力,与常用的单智能体价值分解架构形成对比。
引用
@article{arxiv.2410.01101,
title = {Exploiting Structure in Offline Multi-Agent RL: The Benefits of Low Interaction Rank},
author = {Wenhao Zhan and Scott Fujimoto and Zheqing Zhu and Jason D. Lee and Daniel R. Jiang and Yonathan Efroni},
journal= {arXiv preprint arXiv:2410.01101},
year = {2024}
}