中文

CTVIS:面向在线视频实例分割的一致性训练

计算机视觉与模式识别 2023-07-25 v1 人工智能

摘要

实例嵌入的判别性在在线视频实例分割(VIS)中跨时间关联实例方面起着至关重要的作用。实例嵌入学习直接由基于对比项(CIs,即锚点/正/负嵌入集合)计算的对比损失监督。近期的在线VIS方法仅利用来自单参考帧的CIs,我们认为这不足以学习高度判别性的嵌入。直观上,增强CIs的一种可能策略是在训练期间复现推理阶段。为此,我们提出一种简单而有效的训练策略,称为面向在线VIS的一致性训练(CTVIS),致力于在构建CIs方面对齐训练与推理流程。具体而言,CTVIS通过参考推理时的动量平均嵌入与记忆库存储机制,并向相关嵌入添加噪声来构建CIs。这种扩展允许在当前实例嵌入与历史实例的稳定表示之间进行可靠比较,从而在建模遮挡、重识别与形变等VIS挑战上赋予优势。实证上,CTVIS在YTVIS19(55.1% AP)、YTVIS21(50.1% AP)和OVIS(35.5% AP)三个VIS基准上超越SOTA VIS模型至多+5.0点。此外,我们发现由图像转换的伪视频能够训练出超越全监督模型的鲁棒模型。

关键词

引用

@article{arxiv.2307.12616,
  title  = {CTVIS: Consistent Training for Online Video Instance Segmentation},
  author = {Kaining Ying and Qing Zhong and Weian Mao and Zhenhua Wang and Hao Chen and Lin Yuanbo Wu and Yifan Liu and Chengxiang Fan and Yunzhi Zhuge and Chunhua Shen},
  journal= {arXiv preprint arXiv:2307.12616},
  year   = {2023}
}

备注

Accepted by ICCV 2023. The code is available at https://github.com/KainingYing/CTVIS