InstanceFormer:一种在线视频实例分割框架
计算机视觉与模式识别
2022-11-28 v1
摘要
近期基于Transformer的离线视频实例分割(VIS)方法取得了令人鼓舞的结果,并显著优于在线方法。然而,它们对整段视频的依赖以及由全时空注意力引起的巨大计算复杂度限制了它们在处理长视频等实际应用中的使用。在本文中,我们提出一种基于Transformer的单阶段高效在线VIS框架,名为InstanceFormer,它特别适用于长且具挑战性的视频。我们提出三个新颖组件来建模短期与长期依赖以及时间相干性。首先,我们传播先前实例的表征、位置和语义信息以建模短期变化。其次,我们在解码器中提出一种新颖的记忆交叉注意力,使网络能关注某一时间窗口内的更早实例。最后,我们采用时间对比损失来强制同一实例在所有帧中表征的相干性。记忆注意力与时间相干性尤其有益于长程依赖建模,包括遮挡等挑战性场景。所提出的InstanceFormer在多个数据集上大幅优于先前的在线基准方法。最重要的是,InstanceFormer在如YouTube-VIS-2021和OVIS等具挑战性和长视频数据集上超越了离线方法。代码见 https://github.com/rajatkoner08/InstanceFormer。
引用
@article{arxiv.2208.10547,
title = {InstanceFormer: An Online Video Instance Segmentation Framework},
author = {Rajat Koner and Tanveer Hannan and Suprosanna Shit and Sahand Sharifzadeh and Matthias Schubert and Thomas Seidl and Volker Tresp},
journal= {arXiv preprint arXiv:2208.10547},
year = {2022}
}