通过合成数据和模型合并重新思考大语言模型在医学检索器上的适配
计算与语言
2026-02-05 v1 机器学习
摘要
检索增强生成 (RAG) 已成为 grounding 大语言模型 (LLM) 的基石,提高了知识更新并减少了幻觉现象。最近的研究表明,基于 LLM 的检索模型在 RAG 应用中表现突出。然而,如何将通用型 LLM 适配为有效的领域特定检索器尚存若干技术问题,尤其是在医学等专业领域。我们提出 Synthesize-Train-Merge (STM) 模块化框架,通过合成硬负样本、检索提示优化和模型合并来增强 decoder-only LLM。实验在 MTEB 基准的 12 个医学和通用任务子集上表明,STM 可使任务特定专家提升最高 23.5%(平均提升 7.5%),生成的合并模型既超越单个专家,也优于强大的基线,无需大量预训练。我们的结果表明,这是一条将通用 LLM 转化为高性能、领域专业化检索器的可扩展、高效路径,同时保留了通用领域能力,在专业任务上也表现卓越。
引用
@article{arxiv.2602.04731,
title = {Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging},
author = {Sameh Khattab and Jean-Philippe Corbeil and Osman Alperen Koraş and Amin Dada and Julian Friedrich and François Beaulieu and Paul Vozila and Jens Kleesiek},
journal= {arXiv preprint arXiv:2602.04731},
year = {2026}
}
备注
Preprint