基于局部匹配和时空一致性损失的 X 射线血管造影少样本视频目标分割
计算机视觉与模式识别
2026-03-18 v2
摘要
我们提出了一种新颖的 FSVOS 模型,采用局部匹配策略将搜索空间限制在最相关的邻近像素。我们不是依赖低效的标准 im2col 类实现(例如,空间卷积、深度卷积和特征移位机制)或特定硬件的 CUDA 内核(例如,可变形和邻域注意力),这些方法通常在不同 CUDA 设备上的可移植性有限,而是通过基于方向的采样视角重新组织局部采样过程。具体来说,我们实现了一种非参数采样机制,能够实现动态变化的采样区域。这种方法提供了适应多样化空间结构的灵活性,而无需参数化层的计算成本和模型重训练的需求。为了进一步增强跨帧的特征一致性,我们设计了一种有监督的时空对比学习方案,以强制特征表示的一致性。此外,我们引入了一个公开可用的基准数据集,用于 X 射线血管造影视频中的多目标分割(MOSXAV),其中包含详细的人工标注分割真值。在 CADICA、XACV 和 MOSXAV 数据集上的大量实验表明,我们提出的 FSVOS 方法在分割精度和泛化能力(即已见和未见类别)方面优于当前最先进的视频分割方法。这项工作为广泛的临床应用提供了增强的灵活性和潜力。代码可在 https://github.com/xilin-x/XRAVOS 获取。
引用
@article{arxiv.2601.00988,
title = {Few-Shot Video Object Segmentation in X-Ray Angiography Using Local Matching and Spatio-Temporal Consistency Loss},
author = {Lin Xi and Yingliang Ma and Xiahai Zhuang},
journal= {arXiv preprint arXiv:2601.00988},
year = {2026}
}