中文

面向视频语义分割的时间记忆注意力

计算机视觉与模式识别 2021-09-14 v2 人工智能

摘要

视频语义分割需要利用视频序列各帧之间复杂的时间关系。以往工作通常借助精确的光流来利用时间关系,但深受沉重计算成本之苦。本文提出一种时间记忆注意力网络(TMANet),基于自注意力机制自适应地整合视频序列上的长距离时间关系,而无需穷尽的光流预测。具体而言,我们利用若干过往帧构建记忆以存储当前帧的时间信息,随后提出时间记忆注意力模块来捕获当前帧与记忆之间的关系,从而增强当前帧的表征。我们的方法在两个具有挑战性的视频语义分割数据集上取得了新的 SOTA 性能,在 Cityscapes 上使用 ResNet-50 达到 80.3% mIoU,在 CamVid 上达到 76.5% mIoU。

关键词

引用

@article{arxiv.2102.08643,
  title  = {Temporal Memory Attention for Video Semantic Segmentation},
  author = {Hao Wang and Weining Wang and Jing Liu},
  journal= {arXiv preprint arXiv:2102.08643},
  year   = {2021}
}

备注

ICIP 2021