中文

面向视频实例分割的时序建模框架

计算机视觉与模式识别 2025-03-25 v1

摘要

当代视频实例分割(VIS)方法通常遵循预训练后微调的范式,即对在图像上训练的分割模型在视频上进行微调。然而,缺乏时序知识的预训练模型会引入域间差异,可能对VIS性能产生不利影响。为有效弥合这一差距,本文提出一种新颖的视频预训练方法,以增强VIS模型,尤其是针对实例关系复杂的视频。我们的关键创新聚焦于减少预训练与微调阶段之间的差异。具体而言,我们首先引入一致的伪视频增强以创建多样化的伪视频样本用于预训练,同时保持跨帧的实例一致性。随后,我们引入多尺度时序模块,通过在短期和长期时序跨度上进行自注意力和跨注意力,以增强模型对时序关系的建模能力。我们的方法不对模型架构施加约束,可无缝集成到各种VIS方法中。实验结果表明,在常用的VIS基准数据集上,我们的方法一致优于领先的方法。在具有挑战性的OVIS数据集上,我们的方法在平均精度(average precision)上提升了4.0%。

关键词

引用

@article{arxiv.2503.17672,
  title  = {A Temporal Modeling Framework for Video Pre-Training on Video Instance Segmentation},
  author = {Qing Zhong and Peng-Tao Jiang and Wen Wang and Guodong Ding and Lin Wu and Kaiqi Huang},
  journal= {arXiv preprint arXiv:2503.17672},
  year   = {2025}
}

备注

7 pages, 5figures, 6 tables, Accepted to ICME 2025