中文

基于位置点击模型的_bandit_学习排序:个性化与均等处理

机器学习 2023-11-09 v1 信息检索

摘要

在线学习排序(ONL2R)是推荐系统的基础问题,近年来受到越来越多的关注。在现有 ONL2R 方法中,一种自然的建模架构是多臂_bandit_框架与基于位置的点击模型相结合。然而,由于该问题的组合性质以及基于位置的点击模型中的部分可观测性,为基于 MAB 的带位置点击模型 ONL2R 开发高效在线学习策略极具挑战。迄今为止,基于 MAB 的带位置点击模型 ONL2R 成果仍相当有限,这促使我们在本工作中填补此空白。我们的主要贡献有三方面:i)我们提出首个通用 MAB 框架,涵盖带位置点击模型 ONL2R 的所有关键要素。我们的模型考虑了 ONL2R 排序推荐中的个性化与均等处理,二者均在实践中被广泛使用;ii)基于上述分析框架,我们开发了两种统一的基于贪心与 UCB 的策略,称为 GreedyRank 与 UCBRank,每种均可应用于个性化与均等排序处理;iii)我们证明 GreedyRank 与 UCBRank 在个性化与均等处理下分别享有 O(tlnt)O(\sqrt{t}\ln t)O(tlnt)O(\sqrt{t\ln t}) 的任意时刻次线性后悔。针对根本困难的均等排序处理,我们识别出集体效用函数的类别及其相关充分条件,在此条件下 GreedyRank 与 UCBRank 仍分别可实现 O(tlnt)O(\sqrt{t}\ln t)O(tlnt)O(\sqrt{t\ln t}) 的任意时刻次线性后悔。我们的数值实验亦验证了理论结果,并展示了 GreedyRank 与 UCBRank 在不同问题设置下寻求最优动作的效率。

关键词

引用

@article{arxiv.2311.04528,
  title  = {Bandit Learning to Rank with Position-Based Click Models: Personalized and Equal Treatments},
  author = {Tianchen Zhou and Jia Liu and Yang Jiao and Chaosheng Dong and Yetian Chen and Yan Gao and Yi Sun},
  journal= {arXiv preprint arXiv:2311.04528},
  year   = {2023}
}