一种用于视频语义分割的类级非显著区域泛化框架
计算机视觉与模式识别
2023-01-02 v1
摘要
视频语义分割(VSS)由于真实世界环境的连续性,有利于处理动态场景。一方面,一些方法缓解了连续帧之间预测不一致的问题。另一方面,其他方法利用前一帧作为先验信息来辅助分割当前帧。尽管以往方法在独立同分布(i.i.d)数据上取得了优越性能,但它们在其他未见域上的泛化能力不佳。因此,我们探索了一项新任务,即视频可泛化语义分割(VGSS)任务,该任务同时考虑连续帧与域泛化。本文中,我们针对VGSS任务提出了一种类级非显著区域泛化(CNSG)框架。具体而言,我们首先定义了类级非显著特征,其描述了携带更多可泛化信息的类级非显著区域的特征。然后,我们提出一种类级非显著特征推理策略,以自适应地选择并增强最具泛化性的通道。最后,我们提出帧间非显著质心对齐损失,以缓解VGSS任务中的预测不一致问题。我们还将基于视频的框架扩展到了基于图像的可泛化语义分割(IGSS)任务。实验表明,我们的CNSG框架在VGSS和IGSS任务上均取得了显著改进。
引用
@article{arxiv.2212.14154,
title = {A Class-wise Non-salient Region Generalized Framework for Video Semantic Segmentation},
author = {Yuhang Zhang and Shishun Tian and Muxin Liao and Zhengyu Zhang and Wenbin Zou and Chen Xu},
journal= {arXiv preprint arXiv:2212.14154},
year = {2023}
}