MedCPT:基于大规模 PubMed 搜索日志的对比预训练 Transformer 用于零样本生物医学信息检索
信息检索
2024-01-17 v2 人工智能
计算与语言
定量方法
摘要
信息检索(IR)在生物医学知识获取和临床决策支持中至关重要。尽管近期进展表明语言模型编码器在语义检索上表现更优,但训练此类模型需要大量查询-文献标注,而在生物医学领域难以获取。因此,大多数生物医学 IR 系统仅进行词法匹配。为此,我们提出 MedCPT,这是首个用于生物医学零样本语义 IR 的对比预训练 Transformer 模型。为训练 MedCPT,我们从 PubMed 收集了前所未有的 2.55 亿条用户点击日志。利用这些数据,我们通过对比学习训练了一对紧密集成的检索器与重排序器。实验结果表明,MedCPT 在六项生物医学 IR 任务上确立了新的最先进性能,优于包括 GPT-3 规模的 cpt-text-XL 等更大模型在内的多种基线。此外,MedCPT 还为语义评估生成了更优的生物医学文献与句子表示。因此,MedCPT 可直接应用于各类现实世界生物医学 IR 任务。
引用
@article{arxiv.2307.00589,
title = {MedCPT: Contrastive Pre-trained Transformers with Large-scale PubMed Search Logs for Zero-shot Biomedical Information Retrieval},
author = {Qiao Jin and Won Kim and Qingyu Chen and Donald C. Comeau and Lana Yeganova and W. John Wilbur and Zhiyong Lu},
journal= {arXiv preprint arXiv:2307.00589},
year = {2024}
}
备注
The MedCPT code and API are available at https://github.com/ncbi/MedCPT