基于偏好的多智能体强化学习:数据覆盖与算法技术
机器学习
2025-01-10 v3 人工智能
计算机科学与博弈论
多智能体系统
摘要
我们开创性地研究了基于偏好的多智能体强化学习(PbMARL),探索了其理论基础和实证验证。我们将任务定义为在一般和博弈中,仅从偏好离线数据集中识别纳什均衡,这是一个以稀疏反馈信号为挑战的问题。我们的理论建立了有效PbMARL中纳什均衡的复杂度上界,证明了单策略覆盖是不充分的,并强调了单边数据集覆盖的重要性。这些理论见解通过全面的实验得到了验证。为了提高实际性能,我们进一步引入了两种算法技术。(1)我们提出了一种沿时间轴的均方误差(MSE)正则化,以实现更均匀的奖励分布并改善奖励学习结果。(2)我们提出了一种基于数据集分布的额外惩罚,以引入悲观主义,从而提高训练过程中的稳定性和有效性。我们的发现强调了PbMARL所需的多方面方法,为有效的基于偏好的多智能体系统铺平了道路。
引用
@article{arxiv.2409.00717,
title = {Preference-Based Multi-Agent Reinforcement Learning: Data Coverage and Algorithmic Techniques},
author = {Natalia Zhang and Xinqi Wang and Qiwen Cui and Runlong Zhou and Sham M. Kakade and Simon S. Du},
journal= {arXiv preprint arXiv:2409.00717},
year = {2025}
}
备注
9 pages