用于视频全景分割的时空 Transformer
计算机视觉与模式识别
2022-10-10 v1
摘要
我们针对视频全景分割任务提出一种新颖的解决方案,该任务同时预测像素级语义与实例分割并生成片段级实例轨迹。我们的网络名为 VPS-Transformer,采用基于最先进全景分割网络 Panoptic-DeepLab 的混合架构,结合了用于单帧全景分割的卷积架构和基于纯 Transformer 块实例化的新型视频模块。该 Transformer 配备注意力机制,对当前帧与过去帧骨干网络输出特征之间的时空关系进行建模,以获得更准确且一致的全景估计。由于纯 Transformer 块在处理高分辨率图像时引入大量计算开销,我们提出了若干设计改动以实现更高效的计算。我们研究了如何更有效地在时空体上聚合信息,并比较了具有不同注意力方案的若干 Transformer 块变体。在 Cityscapes-VPS 数据集上的大量实验表明,我们的最佳模型以极小的额外计算将时间一致性与视频全景质量提升了 2.2%。
引用
@article{arxiv.2210.03546,
title = {Time-Space Transformers for Video Panoptic Segmentation},
author = {Andra Petrovai and Sergiu Nedevschi},
journal= {arXiv preprint arXiv:2210.03546},
year = {2022}
}