视频语义分割中的静态-动态类级感知一致性
计算机视觉与模式识别
2024-12-12 v1
摘要
视频语义分割(VSS)在同时定位与地图构建、自动驾驶和监控等众多领域得到了广泛应用,其核心挑战在于如何利用时序信息以获得更好的分割效果。以往的工作主要关注像素级别的静态-动态上下文匹配,运用光流和注意力机制等技术。相反,本文从类级视角重新思考静态-动态上下文,提出一种新型静态-动态类级感知一致性(SD-CPC)框架。在该框架中,本文提出了基于对比学习的多变量类原型,以及一种静态-动态语义对齐模块。前者为模型提供类级约束,获得针对性的类别间特征和多样化的类别内特征。后者首先在帧内建立空间多尺度和多层次的相关性,以实现静态语义对齐;随后基于帧间静态感知差异,进行两阶段跨帧选择性聚合,以实现动态语义对齐。同时,本文提出一种基于窗口的注意力图计算方法,利用跨帧聚合期间注意力点的稀疏性以降低计算成本。广泛的VSPW和Cityscapes数据集上的实验表明,所提方法优于当前最先进的方法。我们的实现将在GitHub上开源。
引用
@article{arxiv.2412.08034,
title = {Static-Dynamic Class-level Perception Consistency in Video Semantic Segmentation},
author = {Zhigang Cen and Ningyan Guo and Wenjing Xu and Zhiyong Feng and Danlan Huang},
journal= {arXiv preprint arXiv:2412.08034},
year = {2024}
}