中文

面向视频语义分割的运动-状态对齐

计算机视觉与模式识别 2023-04-19 v1

摘要

近年来,视频语义分割随着先进的深度神经网络取得了巨大进展。然而,仍存在两个主要挑战,即信息不一致与计算成本。为应对这两大困难,我们提出一种新颖的面向视频语义分割的运动-状态对齐框架,以保持运动与状态的一致性。在该框架中,我们首先构建配备高效解耦Transformer的运动对齐分支以捕获动态语义,保证区域级时间一致性。然后,设计由阶段Transformer组成的状态对齐分支,为当前帧丰富特征空间以提取静态语义并实现像素级状态一致性。接下来,通过语义分配机制,从动态语义中获得每个语义类别的区域描述符,并与来自静态语义的像素描述符相联结。得益于这两类有效信息的对齐,所提方法以针对性方式拾取动态与静态语义,从而一致地分割视频语义区域,以低计算复杂度获得精确位置。在Cityscapes和CamVid数据集上的大量实验表明,所提方法优于最先进方法,并验证了运动-状态对齐框架的有效性。

关键词

引用

@article{arxiv.2304.08820,
  title  = {Motion-state Alignment for Video Semantic Segmentation},
  author = {Jinming Su and Ruihong Yin and Shuaibin Zhang and Junfeng Luo},
  journal= {arXiv preprint arXiv:2304.08820},
  year   = {2023}
}

备注

Accepted by CVPR Workshops 2023