中文

适配视觉语言基础模型用于下一代医学超声图像分析

计算机视觉与模式识别 2026-05-05 v4

摘要

视觉语言基础模型(VLFMs)展现出显著的泛化能力,但其直接应用于医学超声受到深刻的模态差距的严重阻碍。超声独特的声学物理特性,包括散斑噪声、阴影效应和异质纹理,常常降低现成 VLFMs 的性能。为了弥合这一差距,我们提出了一种新颖的混合调谐(Hybrid Tuning, HT)策略,用于基于 CLIP 的模型在超声分析中的参数高效适配。HT 不更新预训练权重,而是冻结视觉骨干网络并集成一个专门的轻量适配器。该适配器包含一个频率滤波模块以抑制领域特定的周期性伪影,以及一个噪声估计模块以动态校准特征表示。在六个多中心数据集上的广泛评估表明,我们的 HT 增强模型在分割和分类任务中均显著优于现有的最先进适配器和医学 VLFMs。值得注意的是,HT 在少样本场景中展现出卓越的数据效率,并在跨数据集泛化方面表现稳健。我们的发现证明,在保留预训练语义先验的同时显式建模超声特定噪声,是释放自动超声诊断基础智能的关键。源代码可在 https://github.com/jinggqu/NextGen-UIA 获取。

关键词

引用

@article{arxiv.2506.08849,
  title  = {Adapting Vision-Language Foundation Model for Next Generation Medical Ultrasound Image Analysis},
  author = {Jingguo Qu and Xinyang Han and Jia Ai and Juan Wu and Tong Zhao and Tonghuan Xiao and Sheng Ning and Yuqi Yang and Jing Qin and Ann Dorothy King and Winnie Chiu-Wing Chu and Jing Cai and Michael Tin-Cheung Ying},
  journal= {arXiv preprint arXiv:2506.08849},
  year   = {2026}
}

备注

This is the author-submitted LaTeX version with original typesetting. The final published version is available at https://doi.org/10.1016/j.eswa.2026.132560