中文

临床问答系统真的需要专门的医学微调吗?

计算与语言 2026-01-21 v1

摘要

临床问答(CQA)行业系统越来越依赖大型语言模型(LLM),然而其部署通常基于一个假设,即领域特定的微调是必不可少的。尽管专门的医学LLM(如BioBERT、BioGPT和PubMedBERT)仍然流行,但它们面临实际限制,包括覆盖范围狭窄、再训练成本高以及适应性有限。基于监督微调(SFT)的方法试图解决这些假设,但继续强化了我们所谓的“专业化谬误”——即认为专门的医学LLM在CQA中天生更优。为了解决这一假设,我们引入了MEDASSESS-X,一个面向部署行业的CQA框架,该框架在推理时而非通过SFT应用对齐。MEDASSESS-X使用轻量级引导向量来引导模型激活向医学上一致的推理,而无需更新模型权重或进行领域特定的再训练。这种推理时对齐层稳定了通用和专门医学LLM的CQA性能,从而解决了“专业化谬误”。实验表明,MEDASSESS-X在所有LLM系列中均带来一致的性能提升,准确率提高高达+6%,事实一致性提高+7%,并将安全错误率降低多达50%。

关键词

引用

@article{arxiv.2601.12812,
  title  = {Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?},
  author = {Sushant Kumar Ray and Gautam Siddharth Kashyap and Sahil Tripathi and Nipun Joshi and Vijay Govindarajan and Rafiq Ali and Jiechao Gao and Usman Naseem},
  journal= {arXiv preprint arXiv:2601.12812},
  year   = {2026}
}

备注

Accepted at EACL 2026 (Industry Track)