无偏级联Bandit:缓解在线学习排序推荐中的曝光偏差
信息检索
2021-08-10 v1
摘要
曝光偏差是推荐系统中一个众所周知的问题,即物品与供应商在推荐结果中未能得到平等呈现。当少数热门物品在推荐列表中反复被过度呈现时,该偏差会随时间被放大,这一问题尤为突出。该现象可视为推荐反馈循环:系统在不同时间点反复推荐某些物品,用户与这些物品的交互会随时间放大针对这些物品的偏差。基于模型或邻域的推荐算法文献已广泛研究此问题,但基于多臂 Bandit 算法等在线推荐模型的相关工作较少。本文研究一类著名 Bandit 算法——线性级联 Bandit(Linear Cascade Bandits)中的曝光偏差。我们分析这些算法处理曝光偏差的能力,并评估其在推荐结果中为物品与供应商提供公平表征的表现。分析揭示这些算法未能公平对待物品与供应商,且未充分为每个用户探索物品空间。为缓解该偏差,我们提出一个折扣因子并将其融入这些算法,以控制各时间步中物品的曝光。为验证所提折扣因子在缓解曝光偏差上的有效性,我们在两个数据集上使用三种级联 Bandit 算法开展实验,结果表明所提方法提升了物品与供应商的曝光公平性。
引用
@article{arxiv.2108.03440,
title = {Unbiased Cascade Bandits: Mitigating Exposure Bias in Online Learning to Rank Recommendation},
author = {Masoud Mansoury and Himan Abdollahpouri and Bamshad Mobasher and Mykola Pechenizkiy and Robin Burke and Milad Sabouri},
journal= {arXiv preprint arXiv:2108.03440},
year = {2021}
}