CEDR:用于文档排序的上下文嵌入
信息检索
2019-08-20 v3 计算与语言
摘要
尽管近来神经排序架构受到了相当多的关注,但作为这些模型输入的词项表示却远未得到同等重视。在本工作中,我们研究了如何利用两个预训练的上下文语言模型(ELMo 和 BERT)进行特定文档排序(ad-hoc document ranking)。通过在 TREC 基准上的实验,我们发现若干现有神经排序架构可从上下文语言模型提供的额外上下文中获益。此外,我们提出了一种联合方法,将 BERT 的分类向量整合进现有神经模型中,并表明其优于最先进的特定文档排序基线。我们将此联合方法称为 CEDR(Contextualized Embeddings for Document Ranking,用于文档排序的上下文嵌入)。我们还解决了使用这些模型进行排序时的实际挑战,包括 BERT 施加的最大输入长度以及上下文语言模型的运行时性能影响。
引用
@article{arxiv.1904.07094,
title = {CEDR: Contextualized Embeddings for Document Ranking},
author = {Sean MacAvaney and Andrew Yates and Arman Cohan and Nazli Goharian},
journal= {arXiv preprint arXiv:1904.07094},
year = {2019}
}
备注
Appeared in SIGIR 2019, 4 pages