coordination 间隙:多智能体交替性度量用于重复游戏中的时间公平性
多智能体系统
2026-03-24 v4 计算机科学与博弈论
机器学习
摘要
多智能体协调困境暴露了个体优化与集体福祉之间的根本性张力,但对这种协调的特征化需要对时序结构和集体动态敏感的度量。作为诊断基准,我们研究了一个源自 BoE 的多智能体变体的 Exes 之战,正式其为一个马尔可夫游戏,其中轮换式协调制度作为周期性协调体制。传统的基于结果的度量(例如效率和 min/max 公平性)是时序盲区的(它们无法区分结构化交替、垄断式或随机访问模式),且随着 n 的增大,公平性比率失去辨别力,掩盖了不公平。为克服此限制,我们将完美交替 (PA) 作为参考协调体制,提出六个新的交替 (ALT) 度量,旨在作为协调质量的时序敏感可观测量。我们使用 Q 学习智能体作为最小自适应诊断基准,并与随机策略空过程进行比较,我们发现清晰的测量失效:尽管表现出误导性的高传统度量(例如奖励公平性常常超过 0.9),学习的策略在 ALT 变体评估下表现比随机基线差高达 81%,这一缺陷已经在两智能体案例中存在,并且随着 n 的增大而加剧。这些结果表明,在该设置中,高聚合收益可以与差的时序协调共存,传统度量可能严重误characterize 出现的动态。我们的发现强调,对于分析多智能体游戏中的协调,必须使用时序感知的可观测量,并将随机策略基线作为解释协调结果相对于机会水平行为的本质基线。
引用
@article{arxiv.2603.05789,
title = {The Coordination Gap: Multi-Agent Alternation Metrics for Temporal Fairness in Repeated Games},
author = {Nikolaos Al. Papadopoulos and Konstantinos Psannis},
journal= {arXiv preprint arXiv:2603.05789},
year = {2026}
}
备注
42 pages, 5 figures, 4 tables, 1 supplementary pdf. Submitted to Social Choice & Welfare