从二元匹配到排序:基于伪排序提升协同过滤理想性能的爬坡之路
信息检索
2024-12-25 v1
摘要
直观上,理想的协同过滤(CF)模型应从用户对所有物品的完整排序中学习,以实现最优的 top-K 推荐。由于实际缺乏完整排序信息,大多数 CF 模型依赖二元损失函数来近似完整排序,导致巨大的性能差距。本文提出一种新型分析方法,利用多序分类概念揭示二元近似与理想情况之间的不可避免差距。然而,在实际中弥合这一差距面临两个巨大挑战:(1)实际数据集中不存在完整排序信息;(2)不存在能够有效消耗排序信息的损失函数。为克服这些挑战,我们提出一种伪排序范式(PRP),通过引入由原始噪声注入机制监督的伪排序来解决排序信息的缺失。此外,我们提出一种新型排序损失函数,专为有效处理排序信息而设计。为确保该方法对伪排序不准确性的鲁棒性,我们将该排序损失函数配备基于梯度的置信机制,以检测并缓解异常梯度。广泛的实验表明,PRP 在四个真实数据集上均显著优于当前最先进的方法。
引用
@article{arxiv.2412.18168,
title = {From Pairwise to Ranking: Climbing the Ladder to Ideal Collaborative Filtering with Pseudo-Ranking},
author = {Yuhan Zhao and Rui Chen and Li Chen and Shuang Zhang and Qilong Han and Hongtao Song},
journal= {arXiv preprint arXiv:2412.18168},
year = {2024}
}