面向流行度分布偏移的鲁棒协同过滤
机器学习
2023-10-18 v1 人工智能
摘要
在领先的协同过滤(CF)模型中,用户和物品的表示容易将训练数据中的流行度偏差作为捷径来学习。流行度捷径技巧有利于分布内(ID)性能,但泛化到分布外(OOD)数据较差,即当测试数据的流行度分布相对于训练数据发生偏移时。为缩小差距,去偏策略试图评估捷径程度并从其表示中缓解它们。然而,存在两个缺陷:(1)在度量捷径程度时,大多数策略仅使用单方面的统计度量(即物品方面的物品频率和用户界面方面的用户频率),无法适应user-item对的组合程度;(2)在缓解捷径时,许多策略假设测试分布已知。这导致低质量的去偏表示。更糟糕的是,这些策略以牺牲ID性能为代价实现OOD可泛化性。在本工作中,我们提出了一种简单而有效的去偏策略PopGo,它在不对测试数据做任何假设的情况下量化并减少交互级流行度捷径。它首先学习一个捷径模型,该模型基于用户和物品的流行度表示得出user-item对的捷径程度。然后,它通过用交互级捷径程度调整预测来训练CF模型。通过从因果和信息论两个角度审视PopGo,我们可以证明它为何鼓励CF模型捕捉关键的与流行度无关的特征,同时排除虚假的与流行度相关的模式。我们使用PopGo在四个基准数据集上对两个高性能CF模型(MF、LightGCN)进行去偏。在ID和OOD测试集上,PopGo均比最先进的去偏策略(如DICE、MACR)取得显著增益。
引用
@article{arxiv.2310.10696,
title = {Robust Collaborative Filtering to Popularity Distribution Shift},
author = {An Zhang and Wenchang Ma and Jingnan Zheng and Xiang Wang and Tat-seng Chua},
journal= {arXiv preprint arXiv:2310.10696},
year = {2023}
}