具有多文档字段的神经排序模型
信息检索
2017-11-28 v1
摘要
深度神经网络最近在即席检索任务中展现出前景。然而,此类模型通常基于文档的单一字段,例如仅考虑文档标题或仅考虑文档正文。由于实践中文档通常具有多个字段,且鉴于BM25F等非神经排序模型已被开发以利用文档结构,本文研究神经模型应如何处理多个文档字段。我们引入了一种可处理短文本字段(如文档标题)和长文本字段(如文档正文)的模型。它还能处理具有可变实例数量的多实例字段,例如每个文档有零个或多个传入锚文本实例。由于字段在覆盖率和质量上有所差异,我们引入了一种掩码方法来处理缺失字段实例,以及一种字段级丢弃方法以避免过度依赖任一字段。正如非神经字段加权研究中所发现的,我们发现排序器联合对整篇文档打分优于生成逐字段分数再聚合。我们发现不同文档字段可能匹配查询的不同方面,因此受益于与查询文本独立表示的比较。本文所引入技术的组合带来了一种能够利用完整文档结构(包括可变长度的多实例和缺失实例数据)的神经排序器。这些技术显著增强了排序器的性能,并且优于具有手工特征的排序学习基线。
引用
@article{arxiv.1711.09174,
title = {Neural Ranking Models with Multiple Document Fields},
author = {Hamed Zamani and Bhaskar Mitra and Xia Song and Nick Craswell and Saurabh Tiwary},
journal= {arXiv preprint arXiv:1711.09174},
year = {2017}
}
备注
To Appear in Proceedings of the 11th ACM International Conference on Web Search and Data Mining (WSDM '17)