中文

通过噪声感知核心集选择实现高效的基于内容的推荐模型训练

机器学习 2026-01-16 v1 信息检索

摘要

基于内容的推荐系统(CRSs)利用内容特征来预测用户-物品交互,是帮助用户浏览信息丰富的网络服务的重要工具。然而,确保 CRSs 的有效性需要大规模甚至连续的模型训练,以适应多样化的用户偏好,这导致了巨大的计算成本和资源需求。应对这一挑战的一个有前景的方法是核心集选择,它识别出一个小的但具有代表性的数据样本子集,在保持模型质量的同时减少训练开销。然而,所选的核心集容易受到用户-物品交互中普遍存在的噪声的影响,尤其是在其规模极小的情况下。为此,我们提出了噪声感知核心集选择(Noise-aware Coreset Selection, NaCS),这是一个专门为 CRSs 设计的框架。NaCS 通过基于训练梯度的次模优化构建核心集,同时利用一个逐步训练的模型来纠正噪声标签。与此同时,我们通过不确定性量化过滤掉低置信度样本,从而细化所选的核心集,避免使用不可靠的交互进行训练。通过大量实验,我们表明 NaCS 为 CRSs 生成了更高质量的核心集,同时实现了比现有核心集选择技术更高的效率。值得注意的是,NaCS 仅使用 1% 的训练数据就恢复了全数据集训练性能的 93-95%。源代码可在 \href{https://github.com/chenxing1999/nacs}{https://github.com/chenxing1999/nacs} 获取。

关键词

引用

@article{arxiv.2601.10067,
  title  = {Efficient Content-based Recommendation Model Training via Noise-aware Coreset Selection},
  author = {Hung Vinh Tran and Tong Chen and Hechuan Wen and Quoc Viet Hung Nguyen and Bin Cui and Hongzhi Yin},
  journal= {arXiv preprint arXiv:2601.10067},
  year   = {2026}
}

备注

WebConf 2026