单阶段视频实例分割:从逐帧输入输出到逐片段输入输出
摘要
许多视频实例分割(VIS)方法将视频序列划分为独立帧以逐帧检测与分割对象。然而,这种逐帧输入输出(FiFo)流程难以有效利用时间信息。基于短片段内相邻帧内容高度连贯的事实,我们提出将单阶段 FiFo 框架扩展为逐片段输入输出(CiCo)框架,以片段为单位进行 VIS。具体而言,我们将短视频片段中所有帧的 FPN 特征堆叠构建时空特征立方体,并将预测头与掩码分支中的 2D 卷积层替换为 3D 卷积层,形成片段级预测头(CPH)与片段级掩码头(CMH)。随后,将实例来自 CPH 的框级预测与来自 CMH 的片段级特征输入小型全卷积网络即可生成该实例的片段级掩码。提出片段级分割损失以确保生成的实例掩码在片段内时间一致。所提 CiCo 策略无需帧间对齐,并可轻松嵌入现有基于 FiFo 的 VIS 方法。为验证 CiCo 策略的通用性与有效性,我们将其应用于两种代表性 FiFo 方法 Yolact \cite{bolya2019yolact} 与 CondInst \cite{tian2020conditional},得到两种新单阶段 VIS 模型,即 CiCo-Yolact 与 CiCo-CondInst,其在 YouTube-VIS 2019、2021 与 OVIS 验证集上分别使用 ResNet50 骨干取得 37.1/37.3\%、35.2/35.4\% 与 17.2/18.0\% 掩码 AP,使用 Swin Transformer tiny 骨干取得 41.8/41.4\%、38.0/38.9\% 与 18.0/18.2\% 掩码 AP,刷新最优性能。CiCo 的代码与视频演示见 \url{https://github.com/MinghanLi/CiCo}。
引用
@article{arxiv.2203.06421,
title = {One-stage Video Instance Segmentation: From Frame-in Frame-out to Clip-in Clip-out},
author = {Minghan Li and Lei Zhang},
journal= {arXiv preprint arXiv:2203.06421},
year = {2022}
}
备注
20 pages