中文

面向稀疏数据集的基于物品嵌入的位置偏差估计

信息检索 2024-03-13 v3

摘要

估计位置偏差是排序学习(Learning to Rank, L2R)中一个众所周知的挑战。电子商务应用(如定向广告和搜索引擎)中的点击数据提供了隐式但丰富的反馈,以改善个性化排序。然而,点击数据固有地包含各种偏差,如位置偏差。基于位置点击模型,已提出结果随机化与回归期望最大化算法(Regression Expectation-Maximization, REM)来估计位置偏差,但它们需要各种(物品, 位置)的配对观测。在广告的实际场景中,营销人员经常以固定的预定顺序展示广告,由于训练数据中各种配对可用性的限制,导致数据集稀疏,给估计带来困难。我们提出了一种利用物品嵌入来缓解(物品, 位置)稀疏性的 REM 变体。使用公开数据集和内部轮播广告点击数据集,我们经验性地表明,结合潜在语义索引(Latent Semantic Indexing, LSI)和变分自编码器(Variational Auto-Encoder, VAE)的物品嵌入提高了位置偏差估计的准确性,且估计出的位置偏差提升了排序学习性能。我们还表明,作为位置偏差估计的嵌入创建方法,LSI 更为有效。

关键词

引用

@article{arxiv.2305.13931,
  title  = {Position Bias Estimation with Item Embedding for Sparse Dataset},
  author = {Shion Ishikawa and Yun Ching Liu and Young-Joo Chung and Yu Hirate},
  journal= {arXiv preprint arXiv:2305.13931},
  year   = {2024}
}