中文

IR 模型与 COVID-19 大流行:性能与挑战的比较研究

信息检索 2023-05-23 v1

摘要

本研究调查了不同信息检索(IR)系统在 COVID-19 大流行期间从科学文献中获取相关信息的效率。研究将 TREC 框架应用于 COVID-19 开放研究数据集(CORD-19),并评估了 BM25、Contriever 和 Bag of Embeddings IR 框架。目标是为应对大流行期间复杂信息环境的搜索引擎构建测试集。研究使用 CORD-19 数据集训练和评估 IR 模型,并将结果与 TREC-COVID IR Challenge 中人工标注的结果进行比较。结果表明,BERT 和 Contriever 等先进 IR 模型能更好地在大流行期间检索相关信息。然而,研究也强调了处理大型数据集的挑战,以及需要聚焦于摘要或总结的策略。总体而言,本研究凸显了在 COVID-19 等危机中有效定制 IR 系统以应对信息过载的重要性,并可指导该领域未来研究与开发。

关键词

引用

@article{arxiv.2305.12528,
  title  = {IR Models and the COVID-19 Pandemic: A Comparative Study of Performance and Challenges},
  author = {Moksh Shukla and Nitik Jain and Shubham Gupta},
  journal= {arXiv preprint arXiv:2305.12528},
  year   = {2023}
}

备注

7 pages, 2 figures