基于上下文老虎机的曝光感知推荐
信息检索
2022-09-07 v1
摘要
曝光偏差是推荐系统中一个众所周知的问题,即推荐结果中物品与供应商的呈现并不均衡。当少数物品(例如热门物品)在推荐列表中反复过度呈现,且用户与这些物品的交互会随时间放大针对它们的偏差,形成反馈循环时,这一问题尤为严重。该问题在基于模型或基于邻域的推荐算法文献中已被广泛研究,但针对在线推荐模型(如基于 Top-K 上下文老虎机、随持续用户反馈动态更新的模型)的工作较少。本文中,我们研究一类著名上下文老虎机算法——线性级联老虎机(Linear Cascading Bandits)中的曝光偏差。我们分析这些算法处理曝光偏差并为推荐结果中物品提供公平表征的能力。我们的分析揭示,这些算法倾向于随时间放大物品间的曝光差异。具体而言,我们观察到这些算法不能恰当地适应用户提供的反馈,即便某些物品未被用户选择,仍频繁推荐它们。为缓解该偏差,我们提出一种曝光感知(Exposure-Aware, EA)奖励模型,基于两个因素更新模型参数:1)用户反馈(即点击与否),以及 2)物品在推荐列表中的位置。由此,所提模型根据物品在推荐列表中的曝光情况控制分配给它们的效用。基于三种上下文老虎机算法在两个真实数据集上的大量实验表明,所提奖励模型在长期中减少了曝光偏差的放大,同时保持了推荐精度。
引用
@article{arxiv.2209.01665,
title = {Exposure-Aware Recommendation using Contextual Bandits},
author = {Masoud Mansoury and Bamshad Mobasher and Herke van Hoof},
journal= {arXiv preprint arXiv:2209.01665},
year = {2022}
}