BioMedSearch:基于大语言模型的多源生物医学检索框架
计算与语言
2026-02-02 v1
摘要
生物医学查询往往依赖于对特定知识的深入理解,如基因调控机制和疾病的病理过程。它们需要对复杂生理过程进行详细分析,并有效整合来自多个数据源的信息,以支持准确的检索和推理。虽然大语言模型(LLMs)在一般推理任务中表现良好,但其生成的生物医学内容常缺乏科学严谨性,由于无法访问权威生物医学数据库,常会捏造蛋白质功能、相互作用以及与真实信息偏离的结构细节。因此,我们提出BioMedSearch,一个基于大语言模型的多源生物医学信息检索框架。该方法集成文献检索、蛋白质数据库和网络搜索功能,以支持准确和高效地处理复杂的生物医学查询。通过子查询分解、关键词提取、任务图构建和多源信息过滤,BioMedSearch生成高质量的问答结果。为评估问答准确性,我们构建了一个多层次数据集BioMedMCQs,包含3000个问题。该数据集覆盖三个推理层次:机制识别、非相邻语义整合和时间因果推理,用于评估BioMedSearch及其他方法在复杂QA任务中的性能。实验结果表明,BioMedSearch在所有层次上均显著优于所有基线模型。具体而言,在第1层,平均准确率从59.1%提升至91.9%;在第2层,提升至81.0%;而在最具挑战性的第3层,平均准确率从36.3%提升至73.4%。代码和BioMedMCQs已公开:https://github.com/CyL-ucas/BioMed_Search
关键词
引用
@article{arxiv.2510.13926,
title = {BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs},
author = {Congying Liu and Xingyuan Wei and Peipei Liu and Yiqing Shen and Yanxu Mao and Tiehan Cui},
journal= {arXiv preprint arXiv:2510.13926},
year = {2026}
}