面向视频语义分割的时间记忆注意力
计算机视觉与模式识别
2021-09-14 v2 人工智能
摘要
视频语义分割需要利用视频序列各帧之间复杂的时间关系。以往工作通常借助精确的光流来利用时间关系,但深受沉重计算成本之苦。本文提出一种时间记忆注意力网络(TMANet),基于自注意力机制自适应地整合视频序列上的长距离时间关系,而无需穷尽的光流预测。具体而言,我们利用若干过往帧构建记忆以存储当前帧的时间信息,随后提出时间记忆注意力模块来捕获当前帧与记忆之间的关系,从而增强当前帧的表征。我们的方法在两个具有挑战性的视频语义分割数据集上取得了新的 SOTA 性能,在 Cityscapes 上使用 ResNet-50 达到 80.3% mIoU,在 CamVid 上达到 76.5% mIoU。
引用
@article{arxiv.2102.08643,
title = {Temporal Memory Attention for Video Semantic Segmentation},
author = {Hao Wang and Weining Wang and Jing Liu},
journal= {arXiv preprint arXiv:2102.08643},
year = {2021}
}
备注
ICIP 2021