解决 Twitter 基于模型的候选生成中数据集偏差的经验教训
信息检索
2021-05-20 v1
摘要
传统上,启发式方法被用于为大规模推荐系统生成候选。基于模型的候选生成具有多个潜在优势,主要是我们可以显式地优化与下游排序模型相同的目标。然而,大规模基于模型的候选生成方法受到数据集偏差问题的困扰,其原因是无法获得关于极不相关候选的代表性数据。用于纠正数据集偏差的流行技术,如逆倾向得分(inverse propensity scoring),在候选生成语境下表现不佳。我们首先探究数据集偏差问题的动态特性,然后展示如何使用随机采样技术来缓解它。最后,在一个微调的新颖应用中,我们展示了将候选生成系统应用于 Twitter 主页时间线时所获得的性能提升。
引用
@article{arxiv.2105.09293,
title = {Lessons Learned Addressing Dataset Bias in Model-Based Candidate Generation at Twitter},
author = {Alim Virani and Jay Baxter and Dan Shiebler and Philip Gautier and Shivam Verma and Yan Xia and Apoorv Sharma and Sumit Binnani and Linlin Chen and Chenguang Yu},
journal= {arXiv preprint arXiv:2105.09293},
year = {2021}
}