中文

对深度信息检索模型的深度探究

信息检索 2017-07-26 v1

摘要

信息检索(IR)系统的有效性变得比以往任何时候都更加重要。深度 IR 模型因其能够从原始文本中自动学习特征而受到越来越多的关注;因此,最近提出了许多深度 IR 模型。然而,这些深度 IR 模型的学习过程类似于黑盒。因此,有必要识别深度 IR 模型自动学习的特征与传统排序学习方法中使用的人工设计特征之间的差异。此外,研究这些深度 IR 模型之间的差异也很有价值。本文旨在对深度 IR 模型进行深度探究。具体而言,我们在两个不同的数据集(包括 Robust 和 LETOR4.0)上进行了广泛的实证研究。我们首先在查询词覆盖度、文档长度、嵌入和鲁棒性方面比较了自动学习的特征与人工设计的特征。结果揭示了相比于人工设计特征的一些劣势。因此,我们建立了改进现有深度 IR 模型的指导原则。此外,我们比较了两类不同的深度 IR 模型,即表示聚焦模型和交互聚焦模型。结果表明,两类深度 IR 模型关注不同类别的词,包括主题相关词和查询相关词。

关键词

引用

@article{arxiv.1707.07700,
  title  = {A Deep Investigation of Deep IR Models},
  author = {Liang Pang and Yanyan Lan and Jiafeng Guo and Jun Xu and Xueqi Cheng},
  journal= {arXiv preprint arXiv:1707.07700},
  year   = {2017}
}

备注

SIGIR 2017 Workshop on Neural Information Retrieval (Neu-IR'17)