中文

基于随机文本生成的信息检索无监督文档扩展

信息检索 2021-10-15 v2

摘要

信息检索(IR)中的挑战之一是词汇失配问题,即查询与文档之间的术语在词法上不同但在语义上相似。尽管近期工作提出通过以附加相关术语丰富其表示来扩展查询或文档以应对该挑战,但它们通常需要大量查询-文档对来训练扩展模型。在本文中,我们提出一种利用预训练语言模型的无监督文档生成扩展(UDEG)框架,其为原始文档生成多样的补充句子,且无需使用查询-文档对的标签进行训练。为生成句子,我们进一步随机扰动其嵌入以生成更多样的句子用于文档扩展。我们在两个标准 IR 基准数据集上验证我们的框架。结果表明我们的框架显著优于相关的 IR 扩展基线。

关键词

引用

@article{arxiv.2105.00666,
  title  = {Unsupervised Document Expansion for Information Retrieval with Stochastic Text Generation},
  author = {Soyeong Jeong and Jinheon Baek and ChaeHun Park and Jong C. Park},
  journal= {arXiv preprint arXiv:2105.00666},
  year   = {2021}
}

备注

SDP@NAACL2021