具有图拉普拉斯正则化的半参数上下文 Bandit
机器学习
2022-05-18 v1 机器学习
摘要
非平稳性在人类行为中普遍存在,在上下文 bandit 中解决该问题具有挑战性。已有几项工作通过研究半参数上下文 bandit 解决了该问题,并警告忽略非平稳性可能会损害性能。另一种普遍的人类行为是社会互动,这已可以通过社交网络或图结构的形式获取。因此,基于图的上下文 bandit 受到了广泛关注。在本文中,我们提出了一种名为“SemiGraphTS”的新型上下文 Thompson 采样算法,用于基于图的半参数奖励模型。我们的算法是首个在该设置下提出的算法。我们推导了累积遗憾的上界,该上界可表示为依赖于图结构的因子与无图半参数模型阶数的乘积。我们通过模拟和真实数据示例评估了所提出的算法与现有算法。
引用
@article{arxiv.2205.08295,
title = {Semi-Parametric Contextual Bandits with Graph-Laplacian Regularization},
author = {Young-Geun Choi and Gi-Soo Kim and Seunghoon Paik and Myunghee Cho Paik},
journal= {arXiv preprint arXiv:2205.08295},
year = {2022}
}