线性随机传递性模型下的随机上下文对决老虎机
机器学习
2022-10-14 v2 机器学习
摘要
我们考虑在带有上下文信息的对决老虎机问题中的后悔最小化任务。在序贯决策问题的每一轮中,学习器进行依赖于上下文的两个备选选择(臂)的选取以相互比较,并接收以噪声偏好信息形式给出的反馈。我们假设反馈过程由具有上下文效用(CoLST)的线性随机传递性模型决定,且学习器的任务是在对决中包含最优臂(具有最高潜在上下文相关效用)。我们提出了一种计算高效的算法,其基于使用底层CoLST模型的扰动上下文相关效用估计来模仿反馈过程做出选择。若每个臂关联一个维特征向量,我们证明在轮学习后达到阶的后悔。此外,我们还通过给出细化现有平均后悔分析的弱后悔下界,确立了的最优性。我们的实验证明了其在CoLST模型特例上相对于最先进算法的优越性。
引用
@article{arxiv.2202.04593,
title = {Stochastic Contextual Dueling Bandits under Linear Stochastic Transitivity Models},
author = {Viktor Bengs and Aadirupa Saha and Eyke Hüllermeier},
journal= {arXiv preprint arXiv:2202.04593},
year = {2022}
}