中文

AutoMIR:无需相关性标签的有效零样本医学信息检索

信息检索 2025-05-27 v2 人工智能

摘要

医学信息检索(MIR)对于从电子健康记录、科学文献和医学数据库等多种来源检索相关医学知识至关重要。然而,由于缺乏相关性标注数据,在医学领域实现有效的零样本稠密检索面临巨大挑战。在本文中,我们引入了一种名为 \textbf{自}学习\textbf{假}设\textbf{文}档\textbf{嵌}入(\textbf{SL-HyDE})的新方法来解决这一问题。SL-HyDE 利用大语言模型(LLM)作为生成器,根据给定的查询生成假设文档。这些生成的文档封装了关键的医学上下文,引导稠密检索器识别最相关的文档。该自学习框架逐步改进伪文档生成和检索,利用未标记的医学语料库,而无需任何相关性标注数据。此外,我们提出了中文医学信息检索基准(CMIRB),这是一个基于真实世界医学场景的综合评估框架,包含五项任务和十个数据集。通过在 CMIRB 上对十个模型进行基准测试,我们确立了评估医学信息检索系统的严格标准。实验结果表明,SL-HyDE 在检索准确率上显著超越 HyDE,同时在各种 LLM 和检索器配置中展现出强大的泛化能力和可扩展性。我们的代码和数据公开可用:https://github.com/ll0ruc/AutoMIR

关键词

引用

@article{arxiv.2410.20050,
  title  = {AutoMIR: Effective Zero-Shot Medical Information Retrieval without Relevance Labels},
  author = {Lei Li and Xiangxu Zhang and Xiao Zhou and Zheng Liu},
  journal= {arXiv preprint arXiv:2410.20050},
  year   = {2025}
}

备注

19 pages, 15 tables