用于上下文图像与视频分割的时间对比预训练
计算机视觉与模式识别
2025-06-24 v1
摘要
上下文学习(ICL)使得在极少标注数据的情况下即可泛化至新任务。然而,主流的ICL方法依赖于网格化策略,缺乏视觉应用所需的灵活性。我们引入了Temporal,一种时间对比自监督目标,用于预训练视觉ICL的提示检索器,并将ICL表述为视频目标分割(VOS)任务。Temporal解决了基于网格方法限制上下文图像数量和分辨率的关键局限性。通过将ICL重新表述为VOS问题,我们的方法支持可变数量的上下文图像,同时保持其完整分辨率。为了解决为查询选择最优上下文集的挑战,我们通过自监督学习在视频上预训练提示检索器,其中相邻帧作为正样本,远距离帧作为负样本。对于图像分割,提示检索器选择相关序列,当其与查询结合时,形成连贯的视频以进行VOS处理。对于视频分割,它识别关键帧,使用我们的ICL流水线预测其掩码,并在整个序列中传播。在MICCAI FLARE 2022上的评估表明,我们的方法相较基线取得了显著改进:图像分割的Dice分数为90.95%(提升10.64%),视频分割的Dice分数为92.45%(提升14.88%)。
引用
@article{arxiv.2506.17837,
title = {Time-Contrastive Pretraining for In-Context Image and Video Segmentation},
author = {Assefa Wahd and Jacob Jaremko and Abhilash Hareendranathan},
journal= {arXiv preprint arXiv:2506.17837},
year = {2025}
}