中文

EchoPilot:基于尺度空间语义提示和可靠性门控记忆的无训练超声视频分割

计算机视觉与模式识别 2026-05-26 v1 人工智能

摘要

超声视频分割临床上具有重要价值,但因信噪比低、边界模糊和解剖结构快速变形,实际应用困难。近期可提示式基础模型虽支持基于点的分割,但直接部署在超声图像上仍不可靠:单个点提供的空间上下文不足以消除尺度歧义,贪心记忆更新会放大早期误差导致严重的时间漂移。我们提出EchoPilot,一个无需训练的超声视频分割框架,仅需稀疏的首帧交互(单个点点击和解剖类别名称)。EchoPilot协调了冻结的医学视觉语言模型进行语义定位、视觉基础模型进行稠密几何特征提取,以及可提示视频分割器进行掩码预测与传递。为解决初始化歧义,我们提出尺度空间语义提示法,首先通过无参数的S.E.E.D.(语义能量-熵密度)准则选择最佳上下文视图,然后从稠密基础特征中无需额外用户交互地合成几何精确的辅助点提示。为减少传递漂移,我们引入可靠性门控记忆更新, selectively freeze the segmentor's memory bank under uncertain predictions,防止误差累积。我们还贡献了首个动态胎儿胎盘超声视频分割数据集,包含671个标注帧。在三个超声视频数据集上,EchoPilot在稀疏交互设置下实现了最新性能,持续优于无训练基线和微调专家模型。

关键词

引用

@article{arxiv.2605.25944,
  title  = {EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory},
  author = {Ruiqiang Xiao and Zhaohu Xing and Yijun Yang and Zhenyan Han and Weiming Wang and Kaishun Wu and Lei Zhu},
  journal= {arXiv preprint arXiv:2605.25944},
  year   = {2026}
}

备注

Early accepted to MICCAI 2026. Project page: https://keeplearning-again.github.io/EchoPilot/