探索扩散模型特征用于零样图视频对象分割
计算机视觉与模式识别
2025-04-09 v1
摘要
本文探讨使用大规模扩散模型进行零样图视频对象分割(Zero-Shot Video Object Segmentation, ZS-VOS),无需在视频数据上微调,也不需训练任何图像分割数据。尽管扩散模型在各类任务中展现出强大的视觉表征能力,但其直接应用于 ZS-VOS 仍鲜有探索。我们的目标是通过识别最适合用于 ZS-VOS 的特征提取过程,确定最佳时间步和层进行特征提取。我们进一步分析了这些特征的亲和性,观察到其与点对应关系高度相关。通过在 DAVIS-17 和 MOSE 上的大量实验,我们发现在 ImageNet 上训练的扩散模型在 ZS-VOS 任务中优于在更大、更具多样性的数据集上训练的模型。此外,我们强调点对应关系在实现高分割精度方面的重要性,并在 ZS-VOS 中取得最新进展。最终,我们的方法在不依赖昂贵图像分割数据集的情况下,达到了与之相当的性能。
引用
@article{arxiv.2504.05468,
title = {Studying Image Diffusion Features for Zero-Shot Video Object Segmentation},
author = {Thanos Delatolas and Vicky Kalogeiton and Dim P. Papadopoulos},
journal= {arXiv preprint arXiv:2504.05468},
year = {2025}
}
备注
Accepted to CVPRW2025