具有语义与上下文细化的深度语义分割网络
计算机视觉与模式识别
2024-12-13 v1 机器学习
图像与视频处理
摘要
语义分割是多媒体处理中的一项基础任务,可用于分析、理解和编辑图像与视频等内容。为加快多媒体数据的分析速度,现有分割研究倾向于通过逐步降低特征图的空间分辨率来提取语义信息。然而,这种方法在恢复高级特征图的分辨率时会引入对齐问题。为解决此问题,本文在分割网络中设计了语义细化模块 (SRM),该模块被设计用于学习每个上采样后特征图像素的变换偏移量,由高分辨率特征图和相邻偏移量指导。通过对上采样特征图应用这些偏移量,SRM 可增强分割网络的语义表示,尤其适用于对象边界附近的像素。此外,本文提出了上下文细化模块 (CRM),用于捕获空间和通道维度上的全局上下文信息。为平衡通道与空间维度之间的差异,我们聚合来自 backbone 四个阶段的语义图,以丰富通道上下文信息。在三个广泛使用的数据集上验证了所提模块的有效性——Cityscapes、Bdd100K 和 ADE20K,显示出优于当前最先进方法的优异性能。此外,本文将这些模块扩展到轻量级分割网络,在 Cityscapes 验证集上实现了 82.5% 的 mIoU,仅需 137.9 GFLOPs。
引用
@article{arxiv.2412.08671,
title = {A Deep Semantic Segmentation Network with Semantic and Contextual Refinements},
author = {Zhiyan Wang and Deyin Liu and Lin Yuanbo Wu and Song Wang and Xin Guo and Lin Qi},
journal= {arXiv preprint arXiv:2412.08671},
year = {2024}
}
备注
Accept by tmm