SPRec:基于自我对弈的推荐去偏方法
信息检索
2025-02-07 v3
摘要
大型语言模型(LLM)在推荐系统领域受到广泛关注。当前研究主要通过监督微调(SFT)适配模型以完成推荐任务。然而,仅使用正样本进行SFT限制了模型对用户偏好的对齐能力。为此,最近的研究者引入了直接偏好优化(DPO),通过离线偏好排序数据显式地将LLMs与用户偏好对齐。然而,我们发现DPO本质上倾向于少数物品,加剧了滤镜气泡问题,最终损害用户体验。本文提出了SPRec——一种 novel 的自我对弈框架,用于缓解过度推荐问题并提升公平性,无需额外数据或人工干预。在每次自我对弈迭代中,模型依次进行SFT步骤和DPO步骤,将离线交互数据视为正样本,将上一次迭代的预测输出视为负样本。这样通过模型的logits重新加权DPO损失函数,从而自适应抑制偏斜物品。在多个真实数据集上的大规模实验表明,SPRec在提升推荐准确率和公平性方面效果显著。实现代码已公开于 https://github.com/RegionCh/SPRec
引用
@article{arxiv.2412.09243,
title = {SPRec: Self-Play to Debias LLM-based Recommendation},
author = {Chongming Gao and Ruijun Chen and Shuai Yuan and Kexin Huang and Yuanqing Yu and Xiangnan He},
journal= {arXiv preprint arXiv:2412.09243},
year = {2025}
}
备注
Accepted by WWW 2025