针对Copeland赌博机的KLUCB方法
机器学习
2019-02-08 v1 机器学习
摘要
多臂赌博机(MAB)问题是一种强化学习框架,其中智能体通过对每个动作的绝对反馈来恰当选择动作以最大化其收益。决斗赌博机问题是MAB问题的一个变体,其中智能体选择一对动作并接收所选动作对的相对反馈。决斗赌博机问题非常适合于建模这样一种场景:无法为每个动作提供定量反馈,但更倾向于对每个动作提供定性反馈,如人类反馈的情况。决斗赌博机已成功应用于在线排序引出、信息检索、搜索引擎改进和临床在线推荐等应用中。我们提出了一种称为Sup-KLUCB的新方法,用于K臂决斗赌博机问题,特别是Copeland赌博机问题,通过将其转化为标准MAB问题。与Sparring和Self-Sparring算法中独立地对一对动作中的每个动作使用MAB算法不同,我们将一对动作组合并用作一个动作。先前的UCB算法(如相对上置信界(RUCB))仅适用于Condorcet决斗赌博机,而该算法适用于一般的Copeland决斗赌博机,包括Condorcet决斗赌博机作为特例。我们的实证结果在Copeland决斗赌博机情况下优于最先进的Double Thompson Sampling(DTS)。
引用
@article{arxiv.1902.02778,
title = {KLUCB Approach to Copeland Bandits},
author = {Nischal Agrawal and Prasanna Chaporkar},
journal= {arXiv preprint arXiv:1902.02778},
year = {2019}
}
备注
10 pages, 2 figures