面向超声理解的大型视觉语言模型基准测试 U2-BENCH
计算机视觉与模式识别
2026-02-24 v4 机器学习
摘要
超声是一种广泛使用的成像模态,对全球医疗至关重要,但其解释因图像质量随操作者、噪声和解剖结构的不同而变化而具有挑战。尽管大型视觉语言模型(LVM)在自然和医学领域已展示出惊人的多模态能力,但其在超声领域的表现仍鲜有探索。我们引入 U2-BENCH,首个全面评估 LVM 在超声理解中的基准测试,涵盖分类、检测、回归和文本生成任务。U2-BENCH 汇聚 7241 例病例,覆盖 15 个解剖区域,定义 8 项临床启发的任务,如诊断、视图识别、病灶定位、临床价值估计和报告生成,涵盖 50 种超声应用场景。我们评估了 23 项最先进的 LVM,包括开源和闭源模型,通用和医学专用模型。我们的结果显示,在图像级分类方面表现突出,但在空间推理和临床语言生成方面仍面临挑战。U2-BENCH 建立了一个严格且统一的测试平台,以加速 LVM 在独特多模态医学超声成像领域的研究。
引用
@article{arxiv.2505.17779,
title = {U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding},
author = {Anjie Le and Henan Liu and Yue Wang and Zhenyu Liu and Rongkun Zhu and Taohan Weng and Jinze Yu and Boyang Wang and Yalun Wu and Kaiwen Yan and Quanlin Sun and Meirui Jiang and Jialun Pei and Siya Liu and Haoyun Zheng and Zhoujun Li and Alison Noble and Jacques Souquet and Xiaoqing Guo and Manxi Lin and Hongcheng Guo},
journal= {arXiv preprint arXiv:2505.17779},
year = {2026}
}