中文

CEQE:用于查询扩展的上下文嵌入

信息检索 2021-03-10 v1

摘要

在这项工作中,我们利用上下文敏感语言模型的最新进展来改进查询扩展任务。诸如 ELMo 和 BERT 之类的上下文词表示模型正迅速取代静态嵌入模型。我们提出了一种新模型——用于查询扩展的上下文嵌入(CEQE),该模型利用以查询为中心的上下文嵌入向量。我们研究了在即席文档检索中为查询扩展生成的上下文表示的行为。我们在概率检索模型上以及结合神经排序模型进行了实验。我们在两个标准 TREC 数据集(Robust 和 Deep Learning)上评估了 CEQE。我们发现,CEQE 在多个数据集上优于基于静态嵌入的扩展方法(在平均精度上,Robust 上提升高达 18%,Deep Learning 上提升高达 31%),并且也优于已验证的概率伪相关反馈(PRF)模型。我们进一步发现,多轮扩展与重排序可带来持续的效果提升,且基于 CEQE 的方法优于其他方法。最终模型结合了神经与基于 CEQE 的扩展分数,在 Robust 数据集上相较最先进的基于 transformer 的重排序模型 Birch,在 P@20 上提升高达 5%,在 AP 上提升 2%。

关键词

引用

@article{arxiv.2103.05256,
  title  = {CEQE: Contextualized Embeddings for Query Expansion},
  author = {Shahrzad Naseri and Jeffrey Dalton and Andrew Yates and James Allan},
  journal= {arXiv preprint arXiv:2103.05256},
  year   = {2021}
}