中文

COPER:面向波斯语 COVID-19 文献的查询自适应基于语义的搜索引擎

信息检索 2021-07-15 v2

摘要

随着预训练语言模型的兴起,将波斯语文本上下文信息纳入处理的新途径已然开启。同时,与许多其他国家(包括伊朗)一样,在抗击 COVID-19 的过程中,伊朗医疗保健杂志发表了大量与 COVID-19 相关的文章,以更好地告知公众现状。然而,在这海量的信息中寻找答案是一项极其困难的任务。在本文中,我们收集了这些文章的大型数据集,利用不同的 BERT 变体以及其他关键词模型(如 BM25 和 TF-IDF),并创建了一个搜索引擎,以在给定用户查询时筛选这些文档并对其进行排序。我们最终的搜索引擎由一个排序器和一个重排序器组成,其可针对查询自适应调整。我们使用语义文本相似度微调模型,并以标准任务指标进行评估。我们的最终方法以显著优势优于其余方法。

关键词

引用

@article{arxiv.2107.05722,
  title  = {COPER: a Query-adaptable Semantics-based Search Engine for Persian COVID-19 Articles},
  author = {Reza Khanmohammadi and Mitra Sadat Mirshafiee and Mehdi Allahyari},
  journal= {arXiv preprint arXiv:2107.05722},
  year   = {2021}
}

备注

7 pages