中文

深度学习推荐系统的数据优化

信息检索 2021-06-22 v1 机器学习

摘要

本文倡导在推荐系统用户数据收集上的隐私保护要求。我们的研究目的有两方面。首先,我们探究数据收集的限制是否会损害基于RNN的推荐的测试质量。我们研究验证性能如何依赖于可用的训练数据量。为此,我们结合使用Top-K准确率、目录覆盖率和新颖性,因为对用户良好的推荐未必由传统准确率度量所捕获。其次,我们询问能否通过使用辅助数据源在最小数据下提升质量。为此我们提出知识迁移,并构建一种表示来衡量数据中购买行为之间的相似性。以此对哪个源领域贡献最大作出合格判断。我们的结果显示:(i)当训练规模增至临界点以上时,测试性能出现饱和。我们还讨论了不同性能度量与数据属性之间的相互作用。此外,我们证明(ii)我们的表示对于衡量购买行为是 meaningful 的。特别地,结果表明若依据我们的相似性度量选择相关源领域,可利用辅助数据提升验证性能。

关键词

引用

@article{arxiv.2106.11218,
  title  = {Data Optimisation for a Deep Learning Recommender System},
  author = {Gustav Hertz and Sandhya Sachidanandan and Balázs Tóth and Emil S. Jørgensen and Martin Tegnér},
  journal= {arXiv preprint arXiv:2106.11218},
  year   = {2021}
}