中文

面向隐式反馈数据集的缺失信息损失函数

机器学习 2018-08-17 v2 人工智能 信息检索 机器学习

摘要

用于隐式反馈推荐系统的隐因子模型通常将未观测到的用户-物品交互(即缺失信息)视为负反馈。这常通过负采样(逐点损失)或排序损失函数(成对或列表式估计)来实现。由于零偏好推荐对大多数常见目标函数而言是有效解,将未知值视为实际零值会导致用户对大多数可用物品获得零偏好推荐。本文提出一种新颖的目标函数,即缺失信息损失(MIL),其明确禁止将未观测的用户-物品交互视为正或负反馈。我们将该损失应用于传统的矩阵分解和基于用户的去噪自编码器,并与交叉熵(逐点和成对)或最近提出的多项对数似然等其他既定目标函数进行比较。MIL在应用于三个数据集时在排序感知指标上取得了有竞争力的性能。此外,我们表明在推荐中取得此种相关性的同时,热门物品的展示频率更低(相对于最佳竞争方法最高降低20%)。这种对热门物品推荐的去偏有利于长尾物品的出现(长尾推荐最高增加50%),这对于具有大量产品目录的推荐系统是一项宝贵特性。

关键词

引用

@article{arxiv.1805.00121,
  title  = {A Missing Information Loss function for implicit feedback datasets},
  author = {Juan Arévalo and Juan Ramón Duque and Marco Creatura},
  journal= {arXiv preprint arXiv:1805.00121},
  year   = {2018}
}

备注

9 pages, 2 figures