非平稳对决_bandits问题
机器学习
2022-02-03 v1 机器学习
摘要
我们研究具有个臂的非平稳对决_bandits问题,其中时间范围由个平稳段组成,每段关联各自的偏好矩阵。学习者反复选择一对臂并观测它们之间的二值偏好作为反馈。为最小化累积后悔,学习者需要尽可能频繁地选取每个平稳段的Condorcet胜者,尽管偏好矩阵与段长度均未知。我们提出算法,并证明了其在平稳情形下期望二值弱后悔的界,该界收紧了当前最优算法的界。我们还给出了非平稳情形的后悔界,且无需已知或。我们进一步提出并分析了两种元算法:用于弱后悔的与用于强后悔的,二者均基于检测窗口方法,可将任意对决_bandits算法作为黑盒算法纳入。最后,我们证明了非平稳情形下期望弱后悔的最坏情况下界。
引用
@article{arxiv.2202.00935,
title = {Non-Stationary Dueling Bandits},
author = {Patrick Kolpaczki and Viktor Bengs and Eyke Hüllermeier},
journal= {arXiv preprint arXiv:2202.00935},
year = {2022}
}