我们何时能在对决赌博机中追踪显著的偏好偏移?
机器学习
2024-01-26 v2 机器学习
摘要
-臂对决赌博机问题,其反馈形式为带噪的成对偏好,因在信息检索、推荐系统等中的应用而被广泛研究。受用户偏好/品味可能随时间演变的考量驱动,我们考虑带分布偏移的对决赌博机问题。具体地,我们研究近期提出的显著偏移概念(Suk and Kpotufe, 2022),并探问能否为对决问题设计一种具有 动态遗憾的自适应算法,其中 为偏好的(未知)显著偏移次数。我们表明该问题的答案取决于底层偏好分布的性质。首先,我们给出一个不可能性结果,在充分研究的 Condorcet 与 SST 偏好分布类下排除了任何具有 动态遗憾的算法。其次,我们表明 是在其中可设计此类算法的流行偏好分布类中最大的一个。总体而言,我们的结果对上述分布类层级中的该问题给出了近乎完整的解决。
引用
@article{arxiv.2302.06595,
title = {When Can We Track Significant Preference Shifts in Dueling Bandits?},
author = {Joe Suk and Arpit Agarwal},
journal= {arXiv preprint arXiv:2302.06595},
year = {2024}
}