中文

通过持续预训练与推理偏好优化稳定医学 LLM 的推理

计算与语言 2025-04-28 v1 人工智能 机器学习

摘要

大型语言模型(LLMs)在医学领域展现出巨大潜力,但因事实准确性、语言特定限制(例如日语)以及在生成推理解释时可靠性问题,尚未能在临床中广泛采用。本文引入Preferred-MedLLM-Qwen-72B,一个72亿参数模型,针对日语医学领域进行优化,以实现高准确率和稳定的推理。我们对Qwen2.5-72B基础模型采用两阶段微调:首先,在全面的日语医学语料库上进行持续预训练(CPT),以植入深厚的领域知识;其次,通过推理偏好优化(RPO),增强可靠推理路径的生成,同时保持高答案准确率。在日语医学执照考试基准测试(IgakuQA)上的评估显示,Preferred-MedLLM-Qwen-72B实现了最先进的性能(0.868准确率),超越了像GPT-4o这样的强大专有模型(0.866)。关键的是,与基线或仅进行CPT的模型不同,后者在要求生成解释时表现出显著的准确率下降(分别下降了最高达11.5%和3.8%),而我们的模型在此类条件下仍保持高准确率(0.868)。这凸显了RPO在稳定推理生成方面的有效性。本工作强调,在准确率之外,还需针对可靠解释进行优化。我们发布Preferred-MedLLM-Qwen-72B模型权重,以推动可信赖的医学LLM研究。

关键词

引用

@article{arxiv.2504.18080,
  title  = {Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization},
  author = {Wataru Kawakami and Keita Suzuki and Junichiro Iwasawa},
  journal= {arXiv preprint arXiv:2504.18080},
  year   = {2025}
}