图神经_bandits
机器学习
2023-08-22 v1
摘要
上下文 bandit 算法旨在基于上下文信息从一组候选臂中选出奖励最高的优臂。各类 bandit 算法因其处理利用-探索困境的能力而被应用于现实场景。受在线推荐场景的启发,本文提出一个名为图神经 Bandits(GNB)的框架,以利用由图神经网络(GNNs)赋能的用户间协作特性。与现有工作估计刚性用户簇不同,我们分别就利用与探索通过估计的用户图来建模“细粒度”的协作效应。随后,为精炼推荐策略,我们在估计的用户图上利用分离的基于 GNN 的模型进行利用与自适应探索。我们提供了理论分析以及多个真实数据集上对比最先进基线的实验结果,以证明所提框架的有效性。
引用
@article{arxiv.2308.10808,
title = {Graph Neural Bandits},
author = {Yunzhe Qi and Yikun Ban and Jingrui He},
journal= {arXiv preprint arXiv:2308.10808},
year = {2023}
}
备注
Accepted to SIGKDD 2023