中文

学习局部与全局时序上下文用于视频语义分割

计算机视觉与模式识别 2024-04-10 v2 人工智能

摘要

上下文信息在视频语义分割(Video Semantic Segmentation, VSS)中扮演着核心角色。本文将 VSS 的上下文总结为两类:局部时序上下文(Local Temporal Contexts, LTC),即来自邻近帧的上下文;以及全局时序上下文(Global Temporal Contexts, GTC),即来自整个视频的上下文。对于 LTC,它包含静态上下文和运动上下文,分别对应邻近帧中的静态和运动内容。此前,静态和运动上下文均已被研究过。然而,尚无研究同时学习这两种高度互补的上下文。因此,我们提出了一种由粗到精的特征挖掘(Coarse-to-Fine Feature Mining, CFFM)技术,以学习 LTC 的统一表示。CFFM 包含两部分:由粗到精的特征聚合(Coarse-to-Fine Feature Assembling, CFFA)和跨帧特征挖掘(Cross-frame Feature Mining, CFM)。CFFA 提取静态和运动上下文,CFM 则从邻近帧中挖掘有用信息以增强目标特征。为了进一步利用更多时序上下文,我们提出了 CFFM++,通过额外学习来自整个视频的 GTC。具体而言,我们从视频中均匀采样若干帧,并通过 k-means 提取全局上下文原型。这些原型中的信息由 CFM 挖掘,以细化目标特征。在流行基准上的实验结果表明,CFFM 和 CFFM++ 的性能优于现有最先进方法。我们的代码已开源:https://github.com/GuoleiSun/VSS-CFFM

关键词

引用

@article{arxiv.2204.03330,
  title  = {Learning Local and Global Temporal Contexts for Video Semantic Segmentation},
  author = {Guolei Sun and Yun Liu and Henghui Ding and Min Wu and Luc Van Gool},
  journal= {arXiv preprint arXiv:2204.03330},
  year   = {2024}
}

备注

Accepted to TPAMI, an extended version of a paper published in CVPR 2022