中文

通过多尺度时空分离注意力 Transformer 进行视频实例分割

计算机视觉与模式识别 2022-03-25 v1

摘要

最先进的基于 transformer 的视频实例分割(VIS)方法通常在注意力计算期间利用单尺度时空特征或逐帧多尺度特征。我们认为此类注意力计算忽略了多尺度时空特征关系,而该关系对于处理视频中目标外观形变至关重要。为解决此问题,我们提出了一种基于 transformer 的 VIS 框架,称为 MS-STS VIS,其在编码器中包含新颖的多尺度时空分离(MS-STS)注意力模块。所提出的 MS-STS 模块有效捕获视频中跨帧的多尺度时空特征关系。我们进一步在解码器中引入注意力块以增强视频不同帧中检测实例的时间一致性。此外,在训练期间引入辅助判别器,以在多尺度时空特征空间内确保更好的前景-背景可分离性。我们在两个基准上进行了大量实验:Youtube-VIS(2019 和 2021)。我们的 MS-STS VIS 在两个基准上均达到 SOTA 性能。当使用 ResNet50 骨干时,我们的 MS-STS 在 AP_75 更高重叠阈值下分别取得 50.1% 的 mask AP,优于文献中最佳报告结果 2.7% 和 4.8%,且在 Youtube-VIS 2019 val. 集上模型大小和速度相当。当使用 Swin Transformer 骨干时,MS-STS VIS 在 Youtube-VIS 2019 val. 集上取得 61.0% 的 mask AP。我们的代码和模型可在 https://github.com/OmkarThawakar/MSSTS-VIS 获取。

关键词

引用

@article{arxiv.2203.13253,
  title  = {Video Instance Segmentation via Multi-scale Spatio-temporal Split Attention Transformer},
  author = {Omkar Thawakar and Sanath Narayan and Jiale Cao and Hisham Cholakkal and Rao Muhammad Anwer and Muhammad Haris Khan and Salman Khan and Michael Felsberg and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2203.13253},
  year   = {2022}
}