部分监测博弈中的鲁棒可逼近性与遗憾最小化
统计理论
2012-02-17 v3 机器学习
统计理论
摘要
可逼近性已成为分析对抗在线学习设定中收益算法的标准工具。我们为所获收益存在歧义(属于一个集合而非单一向量)的博弈发展了一种可逼近性变体。利用该变体,我们处理了部分监测博弈中的可逼近性问题,并为此设定开发了简单高效的算法(即每步复杂度恒定)。最后,我们考虑了重复部分监测博弈中的外部遗憾和内部遗憾,并基于可逼近性理论推导出遗憾最小化策略。
引用
@article{arxiv.1105.4995,
title = {Robust approachability and regret minimization in games with partial monitoring},
author = {Shie Mannor and Vianney Perchet and Gilles Stoltz},
journal= {arXiv preprint arXiv:1105.4995},
year = {2012}
}