中文

基于视频扩散模型的标签高效数据增强:用于心脏荧光术中导线分割

计算机视觉与模式识别 2025-01-29 v4 人工智能

摘要

准确分割介入心脏荧光术视频中的导线对于计算机辅助导航任务至关重要。尽管深度学习方法在导线分割方面表现出高准确性和鲁棒性,但它们需要大量标注数据以实现通用性,凸显了增强模型性能所需的大量标记数据。为此,我们提出了基于分割引导的帧一致性视频扩散模型(Segmentation-guided Frame-consistency Video Diffusion Model, SF-VD),用于生成大量标注荧光术视频,以增强导线分割网络的训练数据。SF-VD 利用标注有限的视频,独立建模场景分布和运动分布。它首先通过生成导线按指定输入掩码位置放置的 2D 荧光术图像来采样场景分布,然后通过逐步生成后续帧来采样运动分布,通过帧一致性策略确保帧间一致性。分割引导机制进一步通过调整导线对比度,以确保合成图像中可见性的多样性。在荧光术数据集上的评估确认了所生成视频的优质质量,并在导线分割方面显示出显著的改进。

关键词

引用

@article{arxiv.2412.16050,
  title  = {Label-Efficient Data Augmentation with Video Diffusion Models for Guidewire Segmentation in Cardiac Fluoroscopy},
  author = {Shaoyan Pan and Yikang Liu and Lin Zhao and Eric Z. Chen and Xiao Chen and Terrence Chen and Shanhui Sun},
  journal= {arXiv preprint arXiv:2412.16050},
  year   = {2025}
}

备注

AAAI 2025