中文

随机上下文对偶_bandit 的方差感知后悔界

机器学习 2024-10-16 v2 最优化与控制 机器学习

摘要

对偶 bandit 是涉及偏好反馈的决策制定的重要框架,这一有价值的特征适用于各种涉及人类交互的应用,如排序、信息检索和推荐系统。虽然在最小化对偶 bandit 中的累积后悔方面已做出大量努力,但当前研究中的一个显著差距是缺乏考虑对偶臂之间成对比较固有不确定性的后悔界。直观上,更大的不确定性意味着问题具有更高的难度。为弥补这一差距,本文研究上下文对偶 bandit 问题,其中对偶臂的二值比较由广义线性模型(GLM)生成。我们提出了一种新的 SupLinUCB 型算法,该算法具有计算效率并享有方差感知后悔界 O~(dt=1Tσt2+d)\tilde O\big(d\sqrt{\sum_{t=1}^T\sigma_t^2} + d\big),其中 σt\sigma_t 是第 tt 轮成对比较的方差,dd 是上下文向量的维度,TT 是时间范围。我们的后悔界在比较确定性的场景中自然符合直观预期,此时算法仅遭受 O~(d)\tilde O(d) 的后悔。我们在合成数据上进行了实证实验,以确认我们的方法相对于先前方差无关算法的优势。

关键词

引用

@article{arxiv.2310.00968,
  title  = {Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits},
  author = {Qiwei Di and Tao Jin and Yue Wu and Heyang Zhao and Farzad Farnoud and Quanquan Gu},
  journal= {arXiv preprint arXiv:2310.00968},
  year   = {2024}
}

备注

24 pages, 2 figures. In ICLR 2024