中文

超越外观:用于稳健视频实例分割的几何线索

计算机视觉与模式识别 2025-07-15 v2

摘要

视频实例分割(VIS)在面对对象遮挡、运动模糊以及时间关联中的外观变化时往往难以稳健处理。为克服这些限制,本 work引入几何感知,通过战略性地利用单目深度估计来增强VIS的鲁棒性。我们系统地研究了三种不同的集成范例。扩展深度通道(EDC)方法将深度图作为分割网络的输入通道进行拼接;共享ViT(SV)设计了一个统一的ViT主干网络,供深度估计和分割分支共享;深度监督(DS)利用深度预测作为辅助训练指导器以学习特征。尽管DS的有效性有限,但基准测试结果表明,EDC和SV显著提升了VIS的鲁棒性。当采用Swin-L主干网络时,我们的EDC方法达到了56.2的AP分数,创下了OVIS基准测试的最新SOTA成绩。本 work最终确立了深度线索作为稳健视频理解的关键使能器。

关键词

引用

@article{arxiv.2507.05948,
  title  = {Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation},
  author = {Quanzhu Niu and Yikang Zhou and Shihao Chen and Tao Zhang and Shunping Ji},
  journal= {arXiv preprint arXiv:2507.05948},
  year   = {2025}
}

备注

Accepted by ICCV 2025 Workshop LSVOS