中文

面向推荐的自动化数据去噪

信息检索 2023-05-29 v2

摘要

在真实场景中,多数平台既收集大规模、天然含噪的隐式反馈,也收集小规模但高度相关的显式反馈。由于数据稀疏问题,隐式反馈常作为训练推荐系统(RS)的默认选择,然而此类数据因用户行为的随机性与多样性可能非常嘈杂。例如,大量点击未必反映真实用户偏好,许多购买可能导致差评或退货。幸而,利用两类反馈优势互补,我们几乎无成本地缓解上述问题。本文提出一种面向推荐的自动化数据去噪框架,\textbf{\textit{AutoDenoise}},其使用少量显式数据作验证集以引导推荐器训练。受课程学习(CL)广义定义启发,AutoDenoise学习在验证性能引导下,沿训练过程自动动态地为各隐式数据样本分配最合适(离散或连续)权重。具体而言,我们用精心设计的控制器网络生成权重,将权重与各输入数据损失结合训练推荐系统,并以强化学习优化控制器以最大化所训RS在无噪验证集上的预期准确率。充分实验表明,AutoDenoise能提升最先进推荐算法在多个公开基准数据集上的性能。

关键词

引用

@article{arxiv.2305.07070,
  title  = {Automated Data Denoising for Recommendation},
  author = {Yingqiang Ge and Mostafa Rahmani and Athirai Irissappane and Jose Sepulveda and James Caverlee and Fei Wang},
  journal= {arXiv preprint arXiv:2305.07070},
  year   = {2023}
}