中文

基于自动质量引导的自监督视频实例分割提升方案

计算机视觉与模式识别 2025-12-09 v1

摘要

视频实例分割 (VIS) 因其对像素级掩码和时间一致性标签的双重要求,面临着显著的标注挑战。虽然近期的无监督方法如 VideoCutLER 通过合成数据消除了光流依赖,但仍受制于合成到真实的域间差距。我们提出 AutoQ-VIS,一种新型无监督框架,通过质量引导的自训练桥接了这一鸿沟。我们的方法在伪标签生成和自动质量评估之间建立了闭环系统,使其能够从合成视频逐步适应真实视频。实验表明,在 YouTubeVIS-2019 val\texttt{val} 数据集上实现了 52.6 AP50\text{AP}_{50} 的 state-of-the-art 性能,超越了之前的 state-of-the-art VideoCutLER 4.4%,且无需任何人工标注。这表明了质量感知自训练对于无监督 VIS 的可行性。我们将在 https://github.com/wcbup/AutoQ-VIS 上发布代码。

关键词

引用

@article{arxiv.2512.06864,
  title  = {Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training},
  author = {Kaixuan Lu and Mehmet Onurcan Kaya and Dim P. Papadopoulos},
  journal= {arXiv preprint arXiv:2512.06864},
  year   = {2025}
}

备注

Accepted to WACV 2026. arXiv admin note: substantial text overlap with arXiv:2508.19808