SeqFormer:用于视频实例分割的时序Transformer
计算机视觉与模式识别
2022-07-22 v2
摘要
本文中,我们提出SeqFormer用于视频实例分割。SeqFormer遵循视觉Transformer的原则,对视频帧间实例关系进行建模。然而,我们观察到,一个独立的实例查询足以捕获视频中的时序实例序列,但注意力机制应与每一帧独立进行。为此,SeqFormer在每帧中定位实例并聚合时序信息,以学习视频级实例的强表征,用于动态预测每帧的掩码序列。实例跟踪自然实现,无需跟踪分支或后处理。在YouTube-VIS上,SeqFormer使用ResNet-50骨干网络取得47.4 AP,使用ResNet-101骨干网络取得49.0 AP,且无任何额外技巧。该成绩分别大幅超越先前最优性能4.6和4.4。此外,结合近期提出的Swin transformer,SeqFormer取得了高达59.3的AP。我们希望SeqFormer能作为一个强基线推动视频实例分割的未来研究,同时以更鲁棒、准确、简洁的模型推进该领域。代码见https://github.com/wjf5203/SeqFormer。
引用
@article{arxiv.2112.08275,
title = {SeqFormer: Sequential Transformer for Video Instance Segmentation},
author = {Junfeng Wu and Yi Jiang and Song Bai and Wenqing Zhang and Xiang Bai},
journal= {arXiv preprint arXiv:2112.08275},
year = {2022}
}
备注
ECCV 2022, Oral