博弈中可行收益集估计的最优速率
机器学习
2026-02-05 v1 人工智能
摘要
我们研究了一种情形:两名玩家以(可能近似的)纳什均衡进行游戏,而学习者仅观察他们的行动,且不了解该均衡或 underlying 游戏。自然问题是,学习者能否通过推断玩家的收益函数来对观察到的行为进行合理化。在生成单个收益估计之外,逆游戏理论旨在识别一组与观察行为一致的收益集合,使其可用于下游应用,如拍卖、定价和安全博弈中的反事实分析和机制设计。我们聚焦于以高概率估计可行收益集合的问题,目标精度为 (以 Hausdorff 度量衡)。我们提供了针对精确和近似均衡 play 的第一个 minimax 最优速率,涵盖零和博弈以及一般博弈。我们的结果为多智能体环境中的集合值收益推断提供了学习理论基础。
关键词
引用
@article{arxiv.2602.04396,
title = {LoRDO: Distributed Low-Rank Optimization with Infrequent Communication},
author = {Andrej Jovanović and Alex Iacob and Mher Safaryan and Ionut-Vlad Modoranu and Lorenzo Sani and William F. Shen and Xinchi Qiu and Dan Alistarh and Nicholas D. Lane},
journal= {arXiv preprint arXiv:2602.04396},
year = {2026}
}
备注
Preprint; under review