中文

UMIT:基于视觉语言模型的医学影像任务统一框架

计算机视觉与模式识别 2025-03-21 v1

摘要

随着深度学习在医学图像分析领域的快速发展,越来越多的视觉语言模型 (VLM) 正被广泛应用于解决复杂的健康和医学问题。然而,现有研究主要聚焦于特定任务或单一模组,限制了其在医学场景中的适用性和可推广性。为此,我们提出了 UMIT:一个专为医学影像任务设计的统一型多模态、多任务 VLM。UMIT 能够解决包括视觉问答、疾病检测和医学报告生成在内的多种任务。此外,它适用于多种影像模组(如 X 光、CT 和 PET),涵盖从基础诊断到复杂病灶分析的广泛应用场景。UMIT 支持英文和中文两种语言,拓展了其在全球范围内的适用性,确保了不同语言背景用户的可及性。为提升模型的适应性和任务处理能力,我们设计了独特的两阶段训练策略,并通过设计的指令模板对 UMIT 进行微调。在大量实验评估中,UMIT 在多个数据集上的五个任务中均优于先前方法。UMIT 的性能表明,它能够显著提升诊断准确性和工作流程效率,为医学影像应用提供了有效解决方案。

关键词

引用

@article{arxiv.2503.15892,
  title  = {UMIT: Unifying Medical Imaging Tasks via Vision-Language Models},
  author = {Haiyang Yu and Siyang Yi and Ke Niu and Minghan Zhuo and Bin Li},
  journal= {arXiv preprint arXiv:2503.15892},
  year   = {2025}
}