Deformable VisTR:面向视频实例分割的时空可变形注意力
计算机视觉与模式识别
2022-03-15 v1
摘要
视频实例分割(VIS)任务要求对视频片段中所有帧的物体实例进行分类、分割与跟踪。近来,VisTR 作为一种基于 transformer 的端到端 VIS 框架被提出,并展现出最先进的性能。然而,由于其 transformer 注意力模块计算代价高昂,VisTR 在训练时收敛缓慢,需要约 1000 GPU 小时。为提升训练效率,我们提出 Deformable VisTR,利用时空可变形注意力模块,该模块仅关注参考点周围一小部分固定的关键时空采样点。这使得 Deformable VisTR 在时空特征图尺寸上实现线性计算复杂度。此外,它仅需原 VisTR 十分之一的 GPU 训练时长即可取得相当的性能。我们在 Youtube-VIS 基准上验证了方法的有效性。代码见 https://github.com/skrya/DefVIS。
引用
@article{arxiv.2203.06318,
title = {Deformable VisTR: Spatio temporal deformable attention for video instance segmentation},
author = {Sudhir Yarram and Jialian Wu and Pan Ji and Yi Xu and Junsong Yuan},
journal= {arXiv preprint arXiv:2203.06318},
year = {2022}
}
备注
Accepted to ICASSP 2022