中文

用于高分辨率语义视频分割的驯化扭曲网络

计算机视觉与模式识别 2023-07-12 v4

摘要

近期快速语义视频分割方法通过跨相邻帧扭曲特征图来减少冗余,极大加快了推理阶段。然而,由于扭曲带来的误差,精度严重下降。本文中,我们提出一种新颖框架,并在扭曲后设计一个简单有效的校正阶段。具体而言,我们构建了一个非关键帧 CNN,融合扭曲的上下文特征与当前空间细节。基于特征融合,我们的上下文特征校正(CFR)模块学习模型与逐帧模型之间的差异以校正扭曲特征。此外,我们的残差引导注意力(RGA)模块利用压缩域中的残差图帮助 CRF 聚焦于易错区域。在 Cityscapes 上的结果表明,在 1024×20481024\times 2048 分辨率下,精度从 67.3%67.3\% 显著提升至 71.6%71.6\%,速度从 65.565.5 FPS 微降至 61.861.8 FPS。对于非刚性类别,如“人”与“物体”,提升甚至高于 18 个百分点。

关键词

引用

@article{arxiv.2005.01344,
  title  = {Tamed Warping Network for High-Resolution Semantic Video Segmentation},
  author = {Songyuan Li and Junyi Feng and Xi Li},
  journal= {arXiv preprint arXiv:2005.01344},
  year   = {2023}
}