面向快速视频语义分割的局部记忆注意力
计算机视觉与模式识别
2021-09-28 v2
摘要
我们提出了一种新颖的神经网络模块,可将现有的单帧语义分割模型转化为视频语义分割流程。与先前工作不同,我们致力于一种简单、快速且通用的模块,其可集成到几乎任意单帧架构中。我们的方法将过去帧中语义信息的丰富表示聚合进一个记忆模块。记忆中存储的信息随后通过注意力机制被访问。与先前基于记忆的方法不同,我们提出了一种快速的局部注意力层,在前序帧的局部区域中提供时间外观线索。我们进一步通过第二个基于注意力的模块将这些线索与当前帧的编码相融合。分割解码器处理融合后的表示以预测最终的语义分割。我们将我们的方法集成进两个流行的语义分割网络:ERFNet 和 PSPNet。我们观察到在 Cityscapes 上 mIoU 分别提升 1.7% 和 2.1%,而 ERFNet 的推理时间仅增加 1.5ms。
引用
@article{arxiv.2101.01715,
title = {Local Memory Attention for Fast Video Semantic Segmentation},
author = {Matthieu Paul and Martin Danelljan and Luc Van Gool and Radu Timofte},
journal= {arXiv preprint arXiv:2101.01715},
year = {2021}
}
备注
Accepted at IROS 2021. Source code is available at https://github.com/mattpfr/lmanet