用于高分辨率语义视频分割的驯化扭曲网络
计算机视觉与模式识别
2023-07-12 v4
摘要
近期快速语义视频分割方法通过跨相邻帧扭曲特征图来减少冗余,极大加快了推理阶段。然而,由于扭曲带来的误差,精度严重下降。本文中,我们提出一种新颖框架,并在扭曲后设计一个简单有效的校正阶段。具体而言,我们构建了一个非关键帧 CNN,融合扭曲的上下文特征与当前空间细节。基于特征融合,我们的上下文特征校正(CFR)模块学习模型与逐帧模型之间的差异以校正扭曲特征。此外,我们的残差引导注意力(RGA)模块利用压缩域中的残差图帮助 CRF 聚焦于易错区域。在 Cityscapes 上的结果表明,在 分辨率下,精度从 显著提升至 ,速度从 FPS 微降至 FPS。对于非刚性类别,如“人”与“物体”,提升甚至高于 18 个百分点。
引用
@article{arxiv.2005.01344,
title = {Tamed Warping Network for High-Resolution Semantic Video Segmentation},
author = {Songyuan Li and Junyi Feng and Xi Li},
journal= {arXiv preprint arXiv:2005.01344},
year = {2023}
}