上下文对决赌博机
机器学习
2015-06-16 v2
摘要
我们考虑在提供以相对成对比较形式给出的有限反馈时,利用上下文信息学习选择动作的问题。我们在 Yue 等人 (2009) 的对决赌博机框架中研究此问题,并将其扩展以纳入上下文。粗略地说,学习者的目标是在某个策略空间中找到最佳策略或行为方式,尽管“最佳”并非总是明确定义。在此,我们提出一个根植于博弈论的崭新且自然的解概念,称为冯·诺依曼赢家(von Neumann winner),即一种能击败或与其它所有策略打平的随机化策略。我们表明该概念克服了现有解法的重要局限,尤其是过去通常使用的孔多塞赢家(Condorcet winner),其需要强且常不现实的假设。随后,我们提出三种高效算法,用于我们的设定中的在线学习,以及从批量式数据近似冯·诺依曼赢家。其中第一种算法实现了特别低的后悔值(regret),即使数据是对抗性的,但其时间和空间需求关于策略空间大小呈线性。另两种算法在可访问用于解决该空间上分类问题的预言机时,其所需时间与空间仅关于策略空间大小呈对数级。
引用
@article{arxiv.1502.06362,
title = {Contextual Dueling Bandits},
author = {Miroslav Dudík and Katja Hofmann and Robert E. Schapire and Aleksandrs Slivkins and Masrour Zoghi},
journal= {arXiv preprint arXiv:1502.06362},
year = {2015}
}
备注
25 pages, 4 figures, Published at COLT 2015