MACCA:基于因果信用分配的离线多智能体强化学习
机器学习
2024-01-01 v2 多智能体系统
摘要
离线多智能体强化学习(MARL)在在线交互不切实际或有风险的场景中具有重要价值。虽然MARL中的独立学习提供了灵活性和可扩展性,但在离线设置中,由于禁止与环境交互,准确地为单个智能体分配信用带来了挑战。在本文中,我们提出了一个新框架,即多智能体因果信用分配(MACCA),以解决离线MARL设置中的信用分配问题。我们的方法MACCA将生成过程表征为动态贝叶斯网络,捕获了环境变量、状态、动作和奖励之间的关系。通过在离线数据上估计该模型,MACCA能够通过分析各个智能体个体奖励的因果关系来学习每个智能体的贡献,从而确保准确且可解释的信用分配。此外,我们方法的模块化使其能够与各种离线MARL方法无缝集成。在理论上,我们证明了在离线数据集的设置下,底层因果结构和智能体生成个体奖励的函数是可识别的,这为我们的建模正确性奠定了基础。在我们的实验中,我们证明了MACCA不仅优于SOTA方法,而且在与其他骨干方法集成时还能提升性能。
引用
@article{arxiv.2312.03644,
title = {MACCA: Offline Multi-agent Reinforcement Learning with Causal Credit Assignment},
author = {Ziyan Wang and Yali Du and Yudi Zhang and Meng Fang and Biwei Huang},
journal= {arXiv preprint arXiv:2312.03644},
year = {2024}
}
备注
16 pages, 4 figures