有限部分监控博弈的分类研究
计算机科学与博弈论
2011-10-13 v3 机器学习
摘要
部分监控博弈构成了一个用于处理具有不完美反馈的序贯决策问题的数学框架:学习器反复选择一个动作,对手以结果回应,然后学习器遭受损失并接收一个反馈信号,这两者都是动作和结果的固定函数。学习器的目标是使其总累积损失最小化。我们基于这些博弈的极小化极大期望遗憾,在分类方面取得了进展。具体而言,我们对几乎所有具有两个结果和有限数量动作的博弈进行了分类:我们证明它们的极小化极大期望遗憾要么为零,要么为、或,并给出了这四类博弈的一个简单且可高效计算的分类方法。我们希望这一结果能作为对所有有限部分监控博弈进行分类的基石。
引用
@article{arxiv.1102.2041,
title = {Toward a Classification of Finite Partial-Monitoring Games},
author = {András Antos and Gábor Bartók and Dávid Pál and Csaba Szepesvári},
journal= {arXiv preprint arXiv:1102.2041},
year = {2011}
}
备注
Submitted for review to Theoretical Computer Science (Special Issue of the conference Algorithmic Learning Theory 2010)