加权Borda准则下的非平稳对抗bandit问题
机器学习
2024-10-01 v2 机器学习
摘要
在K臂对抗bandit中,学习者接收臂间的偏好反馈,臂的谢逊定义为其相对于一个 winner 臂的次优性。该问题的非平稳变体受到用户偏好变化的关注,近期受到重视 (Saha和Gupta, 2022; Buening和Saha, 2023; Suk和Agarwal, 2023)。目标是设计具有低动态谢逊的算法,理想情况下无需提前知道变化幅度。此处的谢逊概念与 winner 臂的概念密切相关,通常取为所谓的Condorcet胜者或Borda胜者。然而,上述结果大多聚焦于Condorcet胜者。与此相比,以Borda版本为焦点的研究相对关注不足。本文首次建立了动态谢逊上界 ,其中 为未知的显著Borda胜者切换次数。我们还引入一种 novel 加权Borda得分框架,该框架不仅泛化了Borda和Condorcet问题,还令人惊讶地允许对Condorcet问题进行Borda式谢逊分析,从而在臂数众多或Condorcet胜者频繁变化的情形下超越了理论上的现有最佳结果。这种泛化以前未知,可能独具兴趣。
引用
@article{arxiv.2403.12950,
title = {Non-Stationary Dueling Bandits Under a Weighted Borda Criterion},
author = {Joe Suk and Arpit Agarwal},
journal= {arXiv preprint arXiv:2403.12950},
year = {2024}
}