神经 bandit 的元聚类
机器学习
2024-09-30 v2 信息检索
摘要
情境 bandit 已被识别为一种强大的框架,用于将推荐过程表述为序列决策过程,其中每个物品被视为一个臂,目标是最小化 T 轮的后悔值。本文研究了一种新问题——神经 bandit 的聚类,通过扩展前期工作至任意奖励函数,在用户异质性与用户相关性之间取得平衡。为解决此问题,我们提出了一种新算法 M-CNB,它利用元学习器来表示和快速适应动态聚类,同时采用基于信息上置置信界 (UCB) 的探索策略。我们提供了该算法的实例相关性能保证,能够抵御对抗性情境,并进一步证明该保证在相同假设下至少优于当前方法。通过在推荐场景和在线分类场景中的大量实验,M-CNB 在 SOTA baseline 上表现出色。这表明该方法在提高在线推荐和在线分类性能方面有效。
引用
@article{arxiv.2408.05586,
title = {Meta Clustering of Neural Bandits},
author = {Yikun Ban and Yunzhe Qi and Tianxin Wei and Lihui Liu and Jingrui He},
journal= {arXiv preprint arXiv:2408.05586},
year = {2024}
}
备注
Accepted by KDD 2024