改进推荐系统中的词表外处理
信息检索
2024-03-28 v1
摘要
推荐系统(RS)对数十亿用户的日常在线体验有着广泛影响,因此对学术界和工业界研究人员而言是一个日益重要的领域。真实 RS 中的一个常见问题是冷启动问题,即用户和物品可能没有足够的信息来产生高质量的推荐。本工作关注一个互补问题:推荐在训练时未见(词表外,或 OOV)的新用户和新物品。这一设定被称为归纳设定,对于基于分解的模型尤为棘手,因为此类模型仅依赖固定参数向量来编码训练时见过的用户/物品。实践中应用的许多现有解决方案通常很朴素,例如将 OOV 用户/物品分配到随机桶中。在本工作中,我们处理了这一问题,并提出了更好地利用可用用户/物品特征以改进嵌入表层面 OOV 处理的方法。我们讨论了通用即插即用方法,这些方法易于应用于大多数 RS 模型,且在不负面影响直推式模型性能的情况下提升归纳性能。我们在 4 个数据集(跨越不同领域)上的 5 个模型中广泛评估了 9 种 OOV 嵌入方法。其中一个数据集是来自某大型社交平台所用知名 RS 的专有生产数据集,该平台服务于数亿日活用户。在我们的实验中,我们发现几种利用 LSH 借助特征相似性的方法在大多数模型-数据集组合上始终优于其他替代方案,其中最佳方法在归纳性能上较工业标准基线实现了 3.74% 的平均提升。我们开源了代码,并希望我们的工作能帮助从业者在处理其 RS 的 OOV 问题时做出更明智的决策,同时进一步激发学术界对改进 RS 中 OOV 支持的研究。
引用
@article{arxiv.2403.18280,
title = {Improving Out-of-Vocabulary Handling in Recommendation Systems},
author = {William Shiao and Mingxuan Ju and Zhichun Guo and Xin Chen and Evangelos Papalexakis and Tong Zhao and Neil Shah and Yozen Liu},
journal= {arXiv preprint arXiv:2403.18280},
year = {2024}
}
备注
11 pages, 6 figures