中文

TREC-COVID第二轮中的CMT:缓解从Web到专业领域搜索的泛化差距

信息检索 2020-11-04 v1 计算与语言

摘要

基于深度预训练语言模型(LMs)的神经排序器已被证明可改善许多信息检索基准。然而,这些方法受预训练域与目标域之间相关性的影响,并依赖大量微调相关性标签。直接将预训练方法应用于特定领域可能导致次优的搜索质量,因为特定领域可能存在领域自适应问题,例如COVID领域。本文提出一种搜索系统以缓解特殊领域自适应问题。该系统利用领域自适应预训练和少样本学习技术,帮助神经排序器缓解领域差异和标签稀缺问题。此外,我们还集成稠密检索以缓解传统稀疏检索的词汇不匹配障碍。我们的系统在TREC-COVID任务第二轮的非人工运行中位居最佳,该任务旨在从与COVID-19相关的科学文献中检索有用信息。我们的代码公开于 https://github.com/thunlp/OpenMatch。

关键词

引用

@article{arxiv.2011.01580,
  title  = {CMT in TREC-COVID Round 2: Mitigating the Generalization Gaps from Web to Special Domain Search},
  author = {Chenyan Xiong and Zhenghao Liu and Si Sun and Zhuyun Dai and Kaitao Zhang and Shi Yu and Zhiyuan Liu and Hoifung Poon and Jianfeng Gao and Paul Bennett},
  journal= {arXiv preprint arXiv:2011.01580},
  year   = {2020}
}

备注

5 pages, 3 figures, 2 tables