中文

面向无偏学习排序的大规模搜索数据集

人工智能 2022-09-21 v2

摘要

无偏学习排序(ULTR)问题因近期深度学习技术和精心设计的去偏算法而取得了巨大进展。然而,在现有基准数据集上取得的可喜结果可能无法推广到实际场景,原因在于这些流行的基准数据集存在以下缺点:(1) 语义特征提取过时,由于缺少原始文本,无法利用像BERT这样最先进的大规模预训练语言模型;(2) 显示特征不完整,难以深入研究ULTR,例如缺少用于分析点击必要偏差的文档摘要显示;(3) 缺乏真实世界的用户反馈,导致实证研究中合成数据集盛行。为克服上述缺点,我们引入了Baidu-ULTR数据集。它包含随机抽样的12亿次搜索会话和7008个专家标注的查询,规模比现有数据集大几个数量级。Baidu-ULTR提供:(1) 原始语义特征和预训练语言模型,便于使用;(2) 充分的显示信息,如位置、显示高度和显示摘要,使得能够利用因果发现和元学习等先进技术全面研究不同偏差;(3) 搜索结果页面(SERP)上丰富的用户反馈,如驻留时间,允许进行用户参与度优化,并促进ULTR中多任务学习的探索。本文介绍了Baidu-ULTR的设计原则以及基准ULTR算法在这一新数据资源上的性能,这有利于探索长尾查询排序和排序预训练任务。Baidu-ULTR数据集及相应的基线实现可在https://github.com/ChuXiaokai/baidu_ultr_dataset获取。

关键词

引用

@article{arxiv.2207.03051,
  title  = {A Large Scale Search Dataset for Unbiased Learning to Rank},
  author = {Lixin Zou and Haitao Mao and Xiaokai Chu and Jiliang Tang and Wenwen Ye and Shuaiqiang Wang and Dawei Yin},
  journal= {arXiv preprint arXiv:2207.03051},
  year   = {2022}
}

备注

15 pages, 9 figures