上下文决斗赌博机的感觉良好汤普森采样
机器学习
2024-04-10 v1 最优化与控制
机器学习
摘要
上下文决斗赌博机(contextual dueling bandits)中,学习器根据上下文比较两个选项,并接收指示哪个更受偏好的反馈,它通过引入上下文信息进行决策和偏好学习,扩展了经典决斗赌博机。针对线性上下文决斗赌博机,已有几种基于上置信界(UCB)的算法被提出。然而,尽管在传统上下文赌博机中观察到后验采样的经验成功,但在该设置下尚未开发出基于后验采样的算法。在本文中,我们提出了一种用于线性上下文决斗赌博机的汤普森采样算法,名为FGTS.CDB。我们算法的核心是一个专门为决斗赌博机定制的新的“感觉良好”(Feel-Good)探索项。该项利用了两个被选臂的独立性,从而避免了分析中的交叉项。我们证明,我们的算法实现了近乎极小化最优的遗憾,即,其中是模型维度,是时间范围。最后,我们在合成数据上评估了我们的算法,观察到FGTS.CDB以较大幅度优于现有算法。
引用
@article{arxiv.2404.06013,
title = {Feel-Good Thompson Sampling for Contextual Dueling Bandits},
author = {Xuheng Li and Heyang Zhao and Quanquan Gu},
journal= {arXiv preprint arXiv:2404.06013},
year = {2024}
}
备注
30 pages, 6 figures