中文

SeqFormer:用于视频实例分割的时序Transformer

计算机视觉与模式识别 2022-07-22 v2

摘要

本文中,我们提出SeqFormer用于视频实例分割。SeqFormer遵循视觉Transformer的原则,对视频帧间实例关系进行建模。然而,我们观察到,一个独立的实例查询足以捕获视频中的时序实例序列,但注意力机制应与每一帧独立进行。为此,SeqFormer在每帧中定位实例并聚合时序信息,以学习视频级实例的强表征,用于动态预测每帧的掩码序列。实例跟踪自然实现,无需跟踪分支或后处理。在YouTube-VIS上,SeqFormer使用ResNet-50骨干网络取得47.4 AP,使用ResNet-101骨干网络取得49.0 AP,且无任何额外技巧。该成绩分别大幅超越先前最优性能4.6和4.4。此外,结合近期提出的Swin transformer,SeqFormer取得了高达59.3的AP。我们希望SeqFormer能作为一个强基线推动视频实例分割的未来研究,同时以更鲁棒、准确、简洁的模型推进该领域。代码见https://github.com/wjf5203/SeqFormer。

关键词

引用

@article{arxiv.2112.08275,
  title  = {SeqFormer: Sequential Transformer for Video Instance Segmentation},
  author = {Junfeng Wu and Yi Jiang and Song Bai and Wenqing Zhang and Xiang Bai},
  journal= {arXiv preprint arXiv:2112.08275},
  year   = {2022}
}

备注

ECCV 2022, Oral