BMRetriever:将大型语言模型微调为更优的生物医学文本检索器
计算与语言
2024-10-07 v2 人工智能
信息检索
定量方法
摘要
开发有效的生物医学检索模型对于在知识密集型生物医学任务中表现出色至关重要,但由于缺乏足够的公开标注生物医学数据和计算资源,这仍然具有挑战性。我们提出了BMRetriever,这是一系列稠密检索器,通过在大规模生物医学语料库上进行无监督预训练,随后在标注数据集和合成数据对的组合上进行指令微调,来增强生物医学检索。在跨越11个数据集的5项生物医学任务上的实验验证了BMRetriever在各种生物医学应用中的有效性。BMRetriever还表现出强大的参数效率,其410M变体优于比其大11.7倍的基线模型,而2B变体的性能与参数超过5B的模型相当。训练数据和模型检查点已在\url{https://huggingface.co/BMRetriever}发布,以确保透明度、可复现性以及在新领域的应用。
引用
@article{arxiv.2404.18443,
title = {BMRetriever: Tuning Large Language Models as Better Biomedical Text Retrievers},
author = {Ran Xu and Wenqi Shi and Yue Yu and Yuchen Zhuang and Yanqiao Zhu and May D. Wang and Joyce C. Ho and Chao Zhang and Carl Yang},
journal= {arXiv preprint arXiv:2404.18443},
year = {2024}
}
备注
Accepted to EMNLP 2024. The model and data are uploaded to \url{https://github.com/ritaranx/BMRetriever}