中文

EchoVLM: 用于通用超声智能的动态专家混合视觉语言模型

计算机视觉与模式识别 2026-04-20 v2

摘要

超声成像因其无电离辐射、成本低和实时成像等优势,已成为早期癌症筛查的首选成像方式。然而,传统超声诊断高度依赖医师专业知识,面临主观性强和诊断效率低等挑战。视觉语言模型(VLM)为解决这一问题提供了有前景的方案,但现有通用模型在超声医学任务中知识有限,在多器官病变识别方面泛化能力差,且在多任务诊断中效率低下。为解决这些局限,我们提出了EchoVLM,一个专门针对超声医学成像的视觉语言模型。该模型采用专家混合架构,在涵盖七个解剖区域的数据上进行训练。该设计使模型能够执行多项任务,包括超声报告生成、诊断和视觉问答(VQA)。实验结果表明,在超声报告生成任务上,EchoVLM相比Qwen2-VL在BLEU-1分数和ROUGE-1分数上分别取得了10.15和4.77的显著提升。这些发现表明EchoVLM在增强超声成像诊断准确率方面具有巨大潜力,从而为未来的临床应用提供了可行的技术解决方案。源代码和模型权重可在https://github.com/Asunatan/EchoVLM获取。

关键词

引用

@article{arxiv.2509.14977,
  title  = {EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence},
  author = {Chaoyin She and Ruifang Lu and Lida Chen and Wei Wang and Qinghua Huang},
  journal= {arXiv preprint arXiv:2509.14977},
  year   = {2026}
}