中文

InfiMed:提升理解与推理能力的低资源医疗多模态大语言模型

计算与语言 2025-10-09 v3 人工智能

摘要

多模态大语言模型(MLLMs)在视觉理解和数学推理等领域取得了显著进展。然而,它们在医疗领域的应用受到两个关键挑战的制约:(1)多模态医疗数据集稀缺且通常包含稀疏信息,限制了推理深度;(2)带有可验证奖励的强化学习(RLVR)虽然在通用领域有效,但无法可靠地提升模型在医疗领域的性能。为了克服这些挑战,在监督微调(SFT)阶段,我们将高质量文本推理数据和通用多模态数据与多模态医疗数据相结合,以高效增强基础医疗能力并恢复基础模型的推理能力。此外,考虑到存在一些信息稀疏的多模态医疗数据集,我们在通用 CoT 样本之外进一步合成了注入反思模式的思维链(CoT),赋予模型初始的反思推理能力,为后续的 RLVR 训练提供结构化基础。最后,我们介绍了我们的 InfiMed 系列模型,InfiMed-SFT-3B 和 InfiMed-RL-3B,两者在七个多模态医疗基准上均提供了 SOTA 性能。值得注意的是,InfiMed-RL-3B 取得了 59.2% 的平均准确率,甚至优于 InternVL3-8B 等更大的模型(后者为 57.3%)。具体而言,在 SFT 阶段我们使用了 188K 个样本,而 RLVR 阶段纳入了 36K 个样本,证明了这两种训练策略在实现卓越性能方面的有效性。我们还进行了一系列广泛的实验,为提升 MLLMs 在医疗场景中的性能提供了有价值的见解。

关键词

引用

@article{arxiv.2505.23867,
  title  = {InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning},
  author = {Zeyu Liu and Zhitian Hou and Guanghao Zhu and Zhijie Sang and Congkai Xie and Hongxia Yang},
  journal= {arXiv preprint arXiv:2505.23867},
  year   = {2025}
}