中文

S2D:稀疏到稠密关键掩码蒸馏用于无监督视频实例分割

计算机视觉与模式识别 2025-12-17 v1

摘要

近年来,视频实例分割的前沿方法高度依赖合成视频数据,这些数据由从对象中心图像数据集(如 ImageNet)生成的人工位移和缩放图像实例掩码。然而,人工位移和缩放图像实例掩码无法准确建模真实视频中的运动,如视角变化、多对象或单个对象部分运动,或相机运动。为解决此问题,我们提出一种仅在真实视频数据上训练的无监督视频实例分割模型。我们从视频帧上的无监督实例分割掩码开始。然而,这些单帧分割 exhibits 时序噪声且质量在视频中变化。因此,我们通过利用深层运动先验识别视频中高质量关键掩码。稀疏关键掩码伪标注 then 用于训练分割模型以实现隐式掩码传递,针对此,我们提出了受时间 DropLoss 辅助的稀疏到稠密蒸馏方法。经过训练后的稠密标签集上,我们的方法在各种基准测试中超过当前最佳方法。

关键词

引用

@article{arxiv.2512.14440,
  title  = {S2D: Sparse-To-Dense Keymask Distillation for Unsupervised Video Instance Segmentation},
  author = {Leon Sick and Lukas Hoyer and Dominik Engel and Pedro Hermosilla and Timo Ropinski},
  journal= {arXiv preprint arXiv:2512.14440},
  year   = {2025}
}

备注

Project Page with Code/Models/Demo: https://leonsick.github.io/s2d/