基于帧间特征融合与帧内特征精炼的视频语义分割
计算机视觉与模式识别
2023-01-11 v1
摘要
视频语义分割旨在为每一视频帧生成准确的语义图。为此,许多工作致力于整合连续帧中的多样信息以增强预测所用特征,其中通常需要通过估计光流进行特征对齐过程。然而,光流不可避免地存在不准确,进而在特征融合中引入噪声并导致不理想的分割结果。本文为应对错位问题,提出一种时空融合(STF)模块来建模多帧特征间稠密成对关系。与先前方法不同,STF在不同空间与时间位置上均匀且自适应地融合特征,并避免了易出错的光流估计。此外,我们进一步利用单帧内特征精炼,提出一种新颖的记忆增强精炼(MAR)模块以应对语义边界处的困难预测。具体而言,MAR可存储从训练样本中提取的边界特征与原型,二者共同构成任务特定记忆,并在推理时用以精炼特征。本质上,MAR可将困难特征移近最可能类别从而使其更具判别性。我们在Cityscapes和CamVid上进行了大量实验,结果表明我们提出的方法显著优于先前方法并达到了最先进性能。代码与预训练模型见 https://github.com/jfzhuang/ST_Memory。
引用
@article{arxiv.2301.03832,
title = {Video Semantic Segmentation with Inter-Frame Feature Fusion and Inner-Frame Feature Refinement},
author = {Jiafan Zhuang and Zilei Wang and Junjie Li},
journal= {arXiv preprint arXiv:2301.03832},
year = {2023}
}