中文

UMind-VL:用于统一 grounding perception 与全面解释的通用超声视觉语言模型

计算机视觉与模式识别 2025-12-01 v1

摘要

尽管医学基础模型取得了显著进展,但超声医学领域缺乏一种综合解决方案,能够连接低层次的超声 grounding perception(如分割、定位)与高层次的超声综合解释(如诊断、推理)。为弥合这一差距,我们提出了 UMind-VL,一个统一的基础模型,旨在协同像级结构理解与复杂临床推理。我们首先引入 UMind-DS,一个大规模多模态数据集,包含来自 16 个解剖区域的 120 万张超声图像-文本对,丰富了标准数据,加入了像级注释和临床医生验证的理由。从架构上看,UMind-VL 包含一种轻量级的 Dynamic Convolutional Mask Decoder,通过动态核生成掩码,这些核由 LLM 输出条件化。这种设计结合任务特定的 token,在单个框架中统一了分割、检测、几何测量和诊断任务。广泛的评估表明,UMind-VL 在现有通用多模态模型方面显著优于现有方法,在分割、检测、关键点定位和诊断推理基准测试中达到或超过最先进的专家模型性能,同时保持强大的泛化能力。我们在图 1 中展示了 UMind-VL 的能力。

关键词

引用

@article{arxiv.2511.22256,
  title  = {UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation},
  author = {Dengbo Chen and Ziwei Zhao and Kexin Zhang and Shishuang Zhao and Junjie Hou and Yaqian Wang and Nianxi Liao and Anlan Sun and Fei Gao and Jia Ding and Yuhang Liu and Dong Wang},
  journal= {arXiv preprint arXiv:2511.22256},
  year   = {2025}
}