面向生物医学问答的 Top K 相关段落检索
计算与语言
2023-08-09 v1 人工智能
信息检索
机器学习
摘要
问答是一项利用大规模文档集合回答事实型问题的任务。其旨在以自然语言针对用户的问题提供精确答案。问答依赖于高效的段落检索来筛选候选上下文,其中传统的稀疏向量空间模型(如 TF-IDF 或 BM25)是事实上的标准方法。在网页上,不存在单篇文章能够提供互联网上针对用户所提问题所有可能答案的情况。现有的稠密段落检索(Dense Passage Retrieval, DPR)模型以 2018 年 12 月 20 日的维基百科转储作为回答问题的源文档进行训练。问答(QA)已取得重大进展,基于大规模标注数据集构建了若干开放域与机器阅读理解系统。然而,在临床领域,该问题仍相对未被充分探索。多项调研表明,生物医学问题无法从维基百科文章中正确作答。本工作中,我们基于现有的 DPR 框架针对生物医学领域,从 Pubmed 文章(可靠的医学问题回答来源)中检索答案。在 BioASQ 问答数据集上评估时,我们微调的稠密检索器取得了 0.81 的 F1 分数。
引用
@article{arxiv.2308.04028,
title = {Top K Relevant Passage Retrieval for Biomedical Question Answering},
author = {Shashank Gupta},
journal= {arXiv preprint arXiv:2308.04028},
year = {2023}
}
备注
6 pages, 5 figures. arXiv admin note: text overlap with arXiv:2004.04906 by other authors