中文

VVitCutLER:用于视频无监督目标检测与分割的框架

计算机视觉与模式识别 2026-05-19 v1

摘要

视频无监督像素级理解在现实场景中仍具有挑战,因为运动模糊、遮挡和快速目标动态常导致时序漂移和闪烁的伪标签。我们提出了 VVitCutLER,一个用于视频目标检测和实例分割的无监督框架,通过时序一致性提高伪标签质量。我们的核心贡献是 VitCut,即一个暂时稳定的伪标签生成器,通过跨帧区域一致性减少场降解期间的误差累积。同时,VitCut 使用蒸馏解码器实现有效的实例掩码预测。然后,基于 VitCut,VVitCutLER 进一步集成了跨帧特征聚合以增强视频层面的鲁棒性。大量实验在标准视频基准上表明,VVitCutLER 在检测和分割性能方面显著提升,同时减少了时序不稳定性。这些结果凸显了对稳健像素级视频理解至关重要的时序一致监督。

关键词

引用

@article{arxiv.2605.17584,
  title  = {VVitCutLER: Towards Unsupervised Object Detection and Segmentation in Videos},
  author = {Zhijing Lu and Khurram Azeem Hashmi and Didier Stricker and Muhammad Zeshan Afzal},
  journal= {arXiv preprint arXiv:2605.17584},
  year   = {2026}
}

备注

11 figures, cvpr workshop