中文

非平稳对决_bandit的最优且高效动态后悔算法

机器学习 2022-06-14 v2 人工智能

摘要

我们研究了在KK臂对决_bandit(Dueling Bandits)中,于非平稳或时变偏好下的\emph{动态后悔最小化}问题。这是一种在线学习设定,智能体在每轮选择一对物品,并仅观察到该对物品的相对二元“胜负”反馈,该反馈由该轮潜在的偏好矩阵采样得到。我们首先研究了对抗性偏好序列下的静态后悔最小化问题,并设计了一种具有O(KT)O(\sqrt{KT})高概率后悔的高效算法。接下来,我们利用类似的算法思想,针对两种非平稳性概念,提出了一种高效且可证明最优的动态后悔最小化算法。具体而言,我们建立了\tO(SKT)\tO(\sqrt{SKT})\tO(VT1/3K1/3T2/3)\tO({V_T^{1/3}K^{1/3}T^{2/3}})的动态后悔保证,其中SS为潜在偏好关系中的“有效切换”总数,VTV_T为“连续变化”非平稳性的度量。尽管非平稳环境在真实系统中具有实用性,但此前尚未有工作研究这些问题的复杂度。我们通过在上述两种非平稳性概念下证明匹配的下界保证,论证了我们算法的最优性。最后,我们通过大量仿真验证了我们的结果,并比较了我们的算法相对于最先进基线的效能。

关键词

引用

@article{arxiv.2111.03917,
  title  = {Optimal and Efficient Dynamic Regret Algorithms for Non-Stationary Dueling Bandits},
  author = {Aadirupa Saha and Shubham Gupta},
  journal= {arXiv preprint arXiv:2111.03917},
  year   = {2022}
}

备注

Accepted to International Conference on Machine Learning (ICML), 2022 [both authors contributed equally]