中文

部分监测博弈中的鲁棒可逼近性与遗憾最小化

统计理论 2012-02-17 v3 机器学习 统计理论

摘要

可逼近性已成为分析对抗在线学习设定中收益算法的标准工具。我们为所获收益存在歧义(属于一个集合而非单一向量)的博弈发展了一种可逼近性变体。利用该变体,我们处理了部分监测博弈中的可逼近性问题,并为此设定开发了简单高效的算法(即每步复杂度恒定)。最后,我们考虑了重复部分监测博弈中的外部遗憾和内部遗憾,并基于可逼近性理论推导出遗憾最小化策略。

关键词

引用

@article{arxiv.1105.4995,
  title  = {Robust approachability and regret minimization in games with partial monitoring},
  author = {Shie Mannor and Vianney Perchet and Gilles Stoltz},
  journal= {arXiv preprint arXiv:1105.4995},
  year   = {2012}
}