ANACONDA:面向自适应非平稳 Dueling Bandits 的改进动态遗憾算法
机器学习
2022-10-27 v1 机器学习
摘要
我们研究了非平稳 dueling bandits 问题,并为该问题提供了首个自适应动态遗憾算法。这一研究路线中仅有的两个现有尝试在多个方面存在不足,包括对非平稳复杂度的悲观度量,以及需要了解偏好变化次数的非自适应参数调整。我们开发了一种基于淘汰的重新调度算法来克服这些缺点,并展示了近优的 动态遗憾界,其中 是在 轮中 Condorcet 获胜者发生变化的次数。这产生了首个针对未知 的近优动态遗憾算法。我们进一步研究了其他相关的非平稳性概念,并在对底层偏好模型做出额外假设的情况下,证明了近优的动态遗憾保证。
引用
@article{arxiv.2210.14322,
title = {ANACONDA: An Improved Dynamic Regret Algorithm for Adaptive Non-Stationary Dueling Bandits},
author = {Thomas Kleine Buening and Aadirupa Saha},
journal= {arXiv preprint arXiv:2210.14322},
year = {2022}
}