中文

ANACONDA:面向自适应非平稳 Dueling Bandits 的改进动态遗憾算法

机器学习 2022-10-27 v1 机器学习

摘要

我们研究了非平稳 dueling bandits 问题,并为该问题提供了首个自适应动态遗憾算法。这一研究路线中仅有的两个现有尝试在多个方面存在不足,包括对非平稳复杂度的悲观度量,以及需要了解偏好变化次数的非自适应参数调整。我们开发了一种基于淘汰的重新调度算法来克服这些缺点,并展示了近优的 O~(SCWT)\tilde{O}(\sqrt{S^{\texttt{CW}} T}) 动态遗憾界,其中 SCWS^{\texttt{CW}} 是在 TT 轮中 Condorcet 获胜者发生变化的次数。这产生了首个针对未知 SCWS^{\texttt{CW}} 的近优动态遗憾算法。我们进一步研究了其他相关的非平稳性概念,并在对底层偏好模型做出额外假设的情况下,证明了近优的动态遗憾保证。

关键词

引用

@article{arxiv.2210.14322,
  title  = {ANACONDA: An Improved Dynamic Regret Algorithm for Adaptive Non-Stationary Dueling Bandits},
  author = {Thomas Kleine Buening and Aadirupa Saha},
  journal= {arXiv preprint arXiv:2210.14322},
  year   = {2022}
}