中文

非平稳对决_bandits问题

机器学习 2022-02-03 v1 机器学习

摘要

我们研究具有KK个臂的非平稳对决_bandits问题,其中时间范围TTMM个平稳段组成,每段关联各自的偏好矩阵。学习者反复选择一对臂并观测它们之间的二值偏好作为反馈。为最小化累积后悔,学习者需要尽可能频繁地选取每个平稳段的Condorcet胜者,尽管偏好矩阵与段长度均未知。我们提出BeattheWinnerReset\mathrm{Beat\, the\, Winner\, Reset}算法,并证明了其在平稳情形下期望二值弱后悔的界,该界收紧了当前最优算法的界。我们还给出了非平稳情形的后悔界,且无需已知MMTT。我们进一步提出并分析了两种元算法:用于弱后悔的DETECT\mathrm{DETECT}与用于强后悔的MonitoredDuelingBandits\mathrm{Monitored\, Dueling\, Bandits},二者均基于检测窗口方法,可将任意对决_bandits算法作为黑盒算法纳入。最后,我们证明了非平稳情形下期望弱后悔的最坏情况下界。

关键词

引用

@article{arxiv.2202.00935,
  title  = {Non-Stationary Dueling Bandits},
  author = {Patrick Kolpaczki and Viktor Bengs and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2202.00935},
  year   = {2022}
}