非平稳对决_bandit的最优且高效动态后悔算法
机器学习
2022-06-14 v2 人工智能
摘要
我们研究了在臂对决_bandit(Dueling Bandits)中,于非平稳或时变偏好下的\emph{动态后悔最小化}问题。这是一种在线学习设定,智能体在每轮选择一对物品,并仅观察到该对物品的相对二元“胜负”反馈,该反馈由该轮潜在的偏好矩阵采样得到。我们首先研究了对抗性偏好序列下的静态后悔最小化问题,并设计了一种具有高概率后悔的高效算法。接下来,我们利用类似的算法思想,针对两种非平稳性概念,提出了一种高效且可证明最优的动态后悔最小化算法。具体而言,我们建立了和的动态后悔保证,其中为潜在偏好关系中的“有效切换”总数,为“连续变化”非平稳性的度量。尽管非平稳环境在真实系统中具有实用性,但此前尚未有工作研究这些问题的复杂度。我们通过在上述两种非平稳性概念下证明匹配的下界保证,论证了我们算法的最优性。最后,我们通过大量仿真验证了我们的结果,并比较了我们的算法相对于最先进基线的效能。
引用
@article{arxiv.2111.03917,
title = {Optimal and Efficient Dynamic Regret Algorithms for Non-Stationary Dueling Bandits},
author = {Aadirupa Saha and Shubham Gupta},
journal= {arXiv preprint arXiv:2111.03917},
year = {2022}
}
备注
Accepted to International Conference on Machine Learning (ICML), 2022 [both authors contributed equally]