中文

DPR:一种缓解推荐反馈循环中偏差累积的算法

信息检索 2023-11-13 v1 人工智能

摘要

基于已部署推荐系统收集的用户反馈训练的推荐模型通常存在偏差。用户反馈受曝光机制显著影响,因为用户仅对曝光给他们的物品提供反馈,并被动忽略未曝光物品,从而产生大量假负样本。此类用户反馈引起的偏差不可避免地被新模型继承并通过反馈循环被放大。此外,假负样本的存在使负采样困难,并在模型用户偏好建模过程中引入虚假信息。近期工作研究了反馈循环与未知曝光机制对推荐质量与用户体验的负面影响,本质上将其视为独立因素而忽略了它们的交叉效应。为解决这些问题,我们从数据迭代与反馈循环视角,在 Missing Not At Random(非随机缺失,\textbf{MNAR})假设下深入分析数据曝光机制,从理论上证明在反馈循环下曝光机制变换中存在一个可用的稳定因子。我们进一步提出动态个性化排序(\textbf{DPR}),一种利用动态重加权在不依赖额外信息的情况下缓解曝光机制与反馈循环交叉效应的无偏算法。此外,我们设计了一个名为通用抗假负(\textbf{UFN})的插件,以缓解假负问题带来的负面影响。我们从理论上证明所提方法缓解了反馈循环与未知曝光机制的负面效应。在真实数据集上的实验结果表明,采用 DPR 的模型能更好地处理偏差累积,且 UFN 在主流损失方法中具有通用性。

关键词

引用

@article{arxiv.2311.05864,
  title  = {DPR: An Algorithm Mitigate Bias Accumulation in Recommendation feedback loops},
  author = {Hangtong Xu and Yuanbo Xu and Yongjian Yang and Fuzhen Zhuang and Hui Xiong},
  journal= {arXiv preprint arXiv:2311.05864},
  year   = {2023}
}