SHAQ:将 Shapley 值理论引入多智能体 Q 学习
机器学习
2023-01-10 v7 人工智能
多智能体系统
摘要
价值分解是全局奖励博弈中多智能体强化学习(MARL)的一种有用技术,然而其底层机制尚未被充分理解。本文通过 Shapley 值理论研究具有可解释性的价值分解理论框架。我们将 Shapley 值推广到 Markov 凸博弈,称为 Markov Shapley 值(MSV),并将其作为全局奖励博弈中的价值分解方法,这由两种博弈的等价性得到。基于 MSV 的性质,我们导出 Shapley-Bellman 最优性方程(SBOE)来评估最优 MSV,其对应于一个最优联合确定性策略。此外,我们提出 Shapley-Bellman 算子(SBO),并证明可求解 SBOE。通过随机逼近和一些变换,建立了一种称为 Shapley Q-learning (SHAQ) 的新 MARL 算法,其实现由 SBO 和 MSV 的理论结果指导。我们还讨论了 SHAQ 与相关价值分解方法的关系。实验中,SHAQ 在所有任务上不仅表现出更优性能,而且具有与理论分析一致的可解释性。本文实现见 https://github.com/hsvgbkhgbv/shapley-q-learning。
引用
@article{arxiv.2105.15013,
title = {SHAQ: Incorporating Shapley Value Theory into Multi-Agent Q-Learning},
author = {Jianhong Wang and Yuan Zhang and Yunjie Gu and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:2105.15013},
year = {2023}
}
备注
Accepted paper for NeurIPS 2022