中文

线性随机传递性模型下的随机上下文对决老虎机

机器学习 2022-10-14 v2 机器学习

摘要

我们考虑在带有上下文信息的对决老虎机问题中的后悔最小化任务。在序贯决策问题的每一轮中,学习器进行依赖于上下文的两个备选选择(臂)的选取以相互比较,并接收以噪声偏好信息形式给出的反馈。我们假设反馈过程由具有上下文效用(CoLST)的线性随机传递性模型决定,且学习器的任务是在对决中包含最优臂(具有最高潜在上下文相关效用)。我们提出了一种计算高效的算法CoLSTIM\texttt{CoLSTIM},其基于使用底层CoLST模型的扰动上下文相关效用估计来模仿反馈过程做出选择。若每个臂关联一个dd维特征向量,我们证明CoLSTIM\texttt{CoLSTIM}TT轮学习后达到O~(dT)\tilde O( \sqrt{dT})阶的后悔。此外,我们还通过给出细化现有平均后悔分析的弱后悔下界,确立了CoLSTIM\texttt{CoLSTIM}的最优性。我们的实验证明了其在CoLST模型特例上相对于最先进算法的优越性。

关键词

引用

@article{arxiv.2202.04593,
  title  = {Stochastic Contextual Dueling Bandits under Linear Stochastic Transitivity Models},
  author = {Viktor Bengs and Aadirupa Saha and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2202.04593},
  year   = {2022}
}