中文

医学多选问答:域细调 vs 检索增强生成 在 4B 参数规模下的受控比较

计算与语言 2026-04-28 v1 信息检索

摘要

部署规模为小的开源大语言模型(LLM)进行医学问答的从业者面临一个反复出现的设计选择:是投入资源进行域细调,还是保持通用模型并通过检索增强生成(RAG)在推理时注入域知识。我们通过固定模型规模、提示模板、解码温度、检索管道和评估协议不变,仅变更(i)模型是否已域适应(Gemma 3 4B vs. MedGemma 4B,两者均为 4-bit 量化并通过 Ollama 提供),以及(ii)检索自医学知识语料库的片段是否被插入提示中。我们在完整的 MedQA-USMLE 4-option 测试分割(1,273 个问题)上评估所有四个 2x2 设计单元,每个问题重复三次(共计 15,276 次 LLM 调用)。域细调相对于通用 4B 基线提升 6.8 个百分点,majority-vote 准确率从 46.4% 提升至 53.3%(McNemar p < 10^-4)。RAG 对 MedMCQA 解释并未在任一模型上产生统计显著提升,且在域细调模型中,点估计略为负值(-1.9 pp,p = 0.16)。在此规模和此基准上,域知识编码于权重优于域知识以上下文形式供应。我们发布完整实验代码和 JSONL 轨迹,以支持复制。

关键词

引用

@article{arxiv.2604.23801,
  title  = {Domain Fine-Tuning vs. Retrieval-Augmented Generation for Medical Multiple-Choice Question Answering: A Controlled Comparison at the 4B-Parameter Scale},
  author = {Avi-ad Avraam Buskila},
  journal= {arXiv preprint arXiv:2604.23801},
  year   = {2026}
}