中文

适配视觉基础模型用于实时超声图像分割

计算机视觉与模式识别 2025-04-01 v1

摘要

我们提出了一种新颖的方法,将分层视觉基础模型适配于实时超声图像分割。现有的超声分割方法通常难以适应新任务,依赖于昂贵的手动标注,而实时方法通常无法达到最先进的性能。为了克服这些限制,我们引入了一个自适应框架,利用视觉基础模型Hiera提取多尺度特征,并与DINOv2表示交织以增强视觉表达能力。然后对这些丰富的特征进行解码,以产生精确且鲁棒的分割。我们在六个公开数据集和一个内部数据集上进行了广泛评估,涵盖了心脏和甲状腺超声分割。实验表明,我们的方法在多个数据集上优于最先进的方法,并且在有限监督下表现出色,在1%和10%数据设置下平均超过nnUNet 20%以上。我们的方法在单个GPU上使用TensorRT实现了约77 FPS的推理速度,从而能够实现实时临床应用。

关键词

引用

@article{arxiv.2503.24368,
  title  = {Adapting Vision Foundation Models for Real-time Ultrasound Image Segmentation},
  author = {Xiaoran Zhang and Eric Z. Chen and Lin Zhao and Xiao Chen and Yikang Liu and Boris Maihe and James S. Duncan and Terrence Chen and Shanhui Sun},
  journal= {arXiv preprint arXiv:2503.24368},
  year   = {2025}
}