中文

寻求更好的超声视频分割基础模型:基于数据视角的 SAM2 微调实证研究

计算机视觉与模式识别 2025-11-11 v1

摘要

超声(US)视频分割仍是一个具有挑战性的问题,因其存在强烈的跨数据集和数据集内变异性、运动伪影以及有限标注数据的限制。虽然诸如 Segment Anything Model 2(SAM2)这类基础模型在零样态和提示引导分割方面表现出强大的能力,但其在医学影像领域的迁移性能力却显著下降。当前的适应性研究主要聚焦于架构修改,而数据特征与训练方案的影响尚未系统性地加以考察。本研究提出了一项针对超声视频分割的 SAM2 适应性数据导向的全面调查。我们分析了训练集规模、视频时长以及数据增强方案对三种范式(任务特定微调、中间适应、多任务联合训练)下适应性能的影响,这三种范式覆盖五个 SAM2 变体及多种提示模式。我们进一步设计了六种超声特异的增强方法,评估其相对于通用策略的效果。实验在三个具有代表性的超声数据集上进行,结果显示数据规模与时序上下文的作用远大于模型架构或初始化方式。此外,联合训练在模态对齐与任务专门化之间提供了一种高效的折中方案。本工作旨在为开发面向 SAM2 的超声视频分析高效、数据感知的适应管线提供实证性见解。

关键词

引用

@article{arxiv.2511.05731,
  title  = {Towards Better Ultrasound Video Segmentation Foundation Model: An Empirical study on SAM2 Finetuning from Data Perspective},
  author = {Xing Yao and Ahana Gangopadhyay and Hsi-Ming Chang and Ravi Soni},
  journal= {arXiv preprint arXiv:2511.05731},
  year   = {2025}
}