中文

加权Borda准则下的非平稳对抗bandit问题

机器学习 2024-10-01 v2 机器学习

摘要

在K臂对抗bandit中,学习者接收臂间的偏好反馈,臂的谢逊定义为其相对于一个 winner 臂的次优性。该问题的非平稳变体受到用户偏好变化的关注,近期受到重视 (Saha和Gupta, 2022; Buening和Saha, 2023; Suk和Agarwal, 2023)。目标是设计具有低动态谢逊的算法,理想情况下无需提前知道变化幅度。此处的谢逊概念与 winner 臂的概念密切相关,通常取为所谓的Condorcet胜者或Borda胜者。然而,上述结果大多聚焦于Condorcet胜者。与此相比,以Borda版本为焦点的研究相对关注不足。本文首次建立了动态谢逊上界 O~(L~1/3K1/3T2/3)\tilde{O}(\tilde{L}^{1/3} K^{1/3} T^{2/3} ),其中 L~\tilde{L} 为未知的显著Borda胜者切换次数。我们还引入一种 novel 加权Borda得分框架,该框架不仅泛化了Borda和Condorcet问题,还令人惊讶地允许对Condorcet问题进行Borda式谢逊分析,从而在臂数众多或Condorcet胜者频繁变化的情形下超越了理论上的现有最佳结果。这种泛化以前未知,可能独具兴趣。

关键词

引用

@article{arxiv.2403.12950,
  title  = {Non-Stationary Dueling Bandits Under a Weighted Borda Criterion},
  author = {Joe Suk and Arpit Agarwal},
  journal= {arXiv preprint arXiv:2403.12950},
  year   = {2024}
}