PreCM: 基于填充的旋转等变卷积模式用于语义分割
计算机视觉与模式识别
2025-05-01 v2
摘要
语义分割是图像处理和计算机视觉的重要分支。随着深度学习的普及,各种卷积神经网络已被提出用于像素级分类和分割任务。然而在实际场景中,成像角度往往是任意的,包括遥感中的水体图像以及医学领域的毛细血管和息肉图像等,这些场景通常缺乏先验方向信息来指导网络提取更有效的特征。在这种情况下,从具有不同方向信息的对象中学习特征构成了重大挑战,因为大多数基于CNN的语义分割网络缺乏旋转等变性来抵抗方向信息的干扰。为应对这一挑战,本文首先构建了一个通用卷积组框架,旨在更充分地利用方向信息并赋予网络旋转等变性。随后,我们以数学方式设计了一种基于填充的旋转等变卷积模式(PreCM),它不仅适用于多尺度图像和卷积核,还可以作为各种类型卷积的替代组件,如膨胀卷积、转置卷积和非对称卷积。为了定量评估图像旋转在语义分割任务中的影响,我们还提出了一种新的评估指标——旋转差异(RD)。在三个数据集上对六种现有语义分割网络进行的替换实验表明,在随机角度旋转下,其基于PreCM的版本的平均交并比(IOU)分别提升了6.91%、10.63%、4.53%、5.93%、7.48%、8.33%,而平均RD值分别降低了3.58%、4.56%、3.47%、3.66%、3.47%、3.43%。
引用
@article{arxiv.2411.01624,
title = {PreCM: The Padding-based Rotation Equivariant Convolution Mode for Semantic Segmentation},
author = {Xinyu Xu and Huazhen Liu and Tao Zhang and Huilin Xiong and Wenxian Yu},
journal= {arXiv preprint arXiv:2411.01624},
year = {2025}
}
备注
14 pages, 14 figures, submitted to TIP