中文

对抗环境下具有弱后悔的决斗_bandit问题

机器学习 2018-12-12 v1 机器学习

摘要

关于多臂 bandit 问题的研究已深入探讨了探索与利用的权衡。然而,存在大量应用并不适合基数绝对值反馈模型(例如一到五的评分)。这催生了决斗 bandit 问题的表述,其中学习器选取一对动作并观测有噪二值反馈,指示两者间的相对偏好。由于两个原因,该问题存在多种不同设定与解释。首先,由于动作全序的缺失,不存在最佳动作的自然定义。已有工作要么显式假设线性序的存在,要么对胜者使用自定义定义。其次,存在多种合理的后悔概念以衡量学习器性能。多数先前工作聚焦于 strong regret\textit{strong regret}(强后悔),其对所选两动作的质量取平均。本工作聚焦于 weak regret\textit{weak regret}(弱后悔),其基于所选两动作中较优者的质量。当配对中劣势动作对配对质量无显著有害影响时,弱后悔是更合适的性能度量。我们研究对抗设定下的决斗 bandit 问题。我们提供了一种算法,在基于效用的设定(隐含全序)与无限制设定下均具理论保证。对于后者,我们使用 Borda winner\textit{Borda winner}(波达胜者),即寻找对均匀随机采样动作获胜概率最大的动作。论文以基于真实世界数据与合成数据的实验结果作结,展示了算法的性能与局限。

关键词

引用

@article{arxiv.1812.04152,
  title  = {Duelling Bandits with Weak Regret in Adversarial Environments},
  author = {Lennard Hilgendorf},
  journal= {arXiv preprint arXiv:1812.04152},
  year   = {2018}
}