中文

基于文本增强域适应的半监督协同过滤

信息检索 2020-07-15 v1 机器学习 机器学习

摘要

数据稀疏性是推荐系统中固有的挑战,其中大部分数据来自用户的隐式反馈。这在设计有效算法时造成了两个困难:首先,大多数用户与系统的交互很少,没有足够的数据用于学习;其次,隐式反馈中没有负样本,通常的做法是进行负采样以生成负样本。然而,这导致一个后果,即许多潜在的正样本被错误标记为负样本,而数据稀疏性会加剧这种错误标记问题。为解决这些困难,我们将基于稀疏隐式反馈的推荐问题视为半监督学习任务,并探索域适应来解决它。我们将从稠密数据中学到的知识迁移到稀疏数据,并关注最具挑战性的情况——用户或物品均无重叠。在这种极端情况下,直接对齐两个数据集的嵌入是相当次优的,因为两个潜在空间编码了非常不同的信息。因此,我们采用域不变文本特征作为锚点来对齐潜在空间。为对齐嵌入,我们提取每个用户和物品的文本特征,并将其与用户和物品的嵌入一起输入域分类器。嵌入被训练以迷惑分类器,而文本特征固定为锚点。通过域适应,源域中的分布模式被迁移到目标域。由于目标部分可由域适应监督,我们放弃在目标数据集中进行负采样以避免标签噪声。我们采用三对真实世界数据集来验证我们迁移策略的有效性。结果表明,我们的模型显著优于现有模型。

关键词

引用

@article{arxiv.2007.07085,
  title  = {Semi-supervised Collaborative Filtering by Text-enhanced Domain Adaptation},
  author = {Wenhui Yu and Xiao Lin and Junfeng Ge and Wenwu Ou and Zheng Qin},
  journal= {arXiv preprint arXiv:2007.07085},
  year   = {2020}
}

备注

KDD 2020 paper