对抗环境下具有弱后悔的决斗_bandit问题
机器学习
2018-12-12 v1 机器学习
摘要
关于多臂 bandit 问题的研究已深入探讨了探索与利用的权衡。然而,存在大量应用并不适合基数绝对值反馈模型(例如一到五的评分)。这催生了决斗 bandit 问题的表述,其中学习器选取一对动作并观测有噪二值反馈,指示两者间的相对偏好。由于两个原因,该问题存在多种不同设定与解释。首先,由于动作全序的缺失,不存在最佳动作的自然定义。已有工作要么显式假设线性序的存在,要么对胜者使用自定义定义。其次,存在多种合理的后悔概念以衡量学习器性能。多数先前工作聚焦于 (强后悔),其对所选两动作的质量取平均。本工作聚焦于 (弱后悔),其基于所选两动作中较优者的质量。当配对中劣势动作对配对质量无显著有害影响时,弱后悔是更合适的性能度量。我们研究对抗设定下的决斗 bandit 问题。我们提供了一种算法,在基于效用的设定(隐含全序)与无限制设定下均具理论保证。对于后者,我们使用 (波达胜者),即寻找对均匀随机采样动作获胜概率最大的动作。论文以基于真实世界数据与合成数据的实验结果作结,展示了算法的性能与局限。
引用
@article{arxiv.1812.04152,
title = {Duelling Bandits with Weak Regret in Adversarial Environments},
author = {Lennard Hilgendorf},
journal= {arXiv preprint arXiv:1812.04152},
year = {2018}
}