任意可计算扩展形式(未知)博弈的极限可计算真理颗粒
计算机科学与博弈论
2025-08-25 v1 机器学习
多智能体系统
理论经济学
摘要
在一个无限多玩家博弈中行动的贝叶斯玩家,如果其先验对对手的策略赋予正概率(或包含一个真理颗粒),则学会预测其他玩家的策略。Kalai和Lehrer的经典真理颗粒问题是找到一个足够大的策略类,使其包含相对于该类的贝叶斯最优策略,从而允许关于策略选择的相互一致的信念,这些信念服从贝叶斯推断的规则。仅已知少数类具有真理颗粒,文献中包含若干相关的不可能性结果。在本文中,我们为完整的真理颗粒问题提供了一个形式化和通用的解:我们构造了一个足够宽的策略类,使其能够包含所有可计算策略以及对于该类上每个合理先验的贝叶斯最优策略。当环境是已知的重复阶段博弈时,我们证明了在[KL93a]和[KL93b]意义下的收敛性。当环境未知时,使用汤普森采样的智能体在任意未知可计算多智能体环境中收敛到ε-纳什均衡。最后,我们包括了一个避免规划的自预测策略的应用。虽然这些结果仅将可计算性理论作为概念工具来解决一个经典博弈论问题,但我们展示了我们的解可以自然地任意精确地计算逼近。
引用
@article{arxiv.2508.16245,
title = {Limit-Computable Grains of Truth for Arbitrary Computable Extensive-Form (Un)Known Games},
author = {Cole Wyeth and Marcus Hutter and Jan Leike and Jessica Taylor},
journal= {arXiv preprint arXiv:2508.16245},
year = {2025}
}
备注
42 pages; 2 figures; 7 algorithms