多智能体系统中基于策略类型的Best-Response学习的收敛性与最优性
人工智能
2019-07-17 v1 多智能体系统
摘要
尽管许多多智能体算法是为同构系统(即所有智能体相同)设计的,但存在一些重要应用要求智能体在事先不知道其他智能体如何行为的情况下协调其动作。使该问题可行的一种方法是假设其他智能体从其特定集合中抽取其潜在策略(或类型),并且领域专家可以提供该集合的规范,尽管仅是部分正确的。若干研究者已提出算法来计算此类策略库上的后验信念,进而可用于确定最优动作。在本文中,我们就该方法的两个核心设计参数提供理论指导:首先,用户选择能够学习潜在类型真实分布的后验至关重要,否则可能选择次优动作。我们分析了两种现有后验公式的收敛性质,并提出了一种能够学习相关分布的新后验。其次,由于类型由专家提供,它们可能不准确,即无法预测智能体观测到的动作。我们提供了一种新颖的最优性刻画,使专家能够使用高效的模型检验算法来验证类型的最优性。
引用
@article{arxiv.1907.06995,
title = {On Convergence and Optimality of Best-Response Learning with Policy Types in Multiagent Systems},
author = {Stefano V. Albrecht and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:1907.06995},
year = {2019}
}
备注
Proceedings of the 30th Conference on Uncertainty in Artificial Intelligence (UAI), 2014. arXiv admin note: substantial text overlap with arXiv:1507.07688