硬样本 vs 噪声:利用大型语言模型解决推荐系统中的硬噪声混淆问题
信息检索
2025-11-12 v2 人工智能
摘要
隐式反馈用于训练推荐系统时,必然会因 misclick 和位置偏差等因素引入噪声。以往研究尝试通过数据模式差异(如更高的损失值)识别噪声样本,并通过删除或重新加权来减轻其影响。然而,我们注意到噪声样本和困难样本显示出相似的模式,导致硬噪声混淆问题。这种混淆问题具有问题,因为困难样本对于建模用户偏好至关重要。为解决此问题,我们提出LLMHNI框架,利用大型语言模型(LLM)生成的两个辅助用户-物品相关信号来区分困难样本和噪声样本。LLMHNI从LLM编码的嵌入中获取用户-物品语义相关性,用于在负采样中选择困难负样本,同时过滤噪声假负样本。提出了一种目标对齐策略,将原本用于通用语言任务的LLM嵌入投影到针对用户-物品相关性建模优化的表示空间。LLMHNI还利用LLM推断的逻辑相关性来识别困难样本和噪声样本。这些LLM推断的交互被整合到交互图中,并通过跨图对齐指导去噪。为消除LLM幻觉引起的不可靠交互影响,我们提出了一种图对比学习策略,通过对随机边缘删除的视图进行对齐来抑制不可靠边缘。实证结果表明,LLMHNI显著改善了去噪和推荐性能。
引用
@article{arxiv.2511.07295,
title = {Hard vs. Noise: Resolving Hard-Noisy Sample Confusion in Recommender Systems via Large Language Models},
author = {Tianrui Song and Wen-Shuo Chao and Hao Liu},
journal= {arXiv preprint arXiv:2511.07295},
year = {2025}
}
备注
Accepted by AAAI 2026