基于随机稀疏卷积的图像分类:多分支特征提取与上下文激发
计算机视觉与模式识别
2026-04-29 v1
摘要
图像分类是计算机视觉中既基础又富有挑战性的任务,尤其当需要同时进行细粒度特征提取和背景噪声抑制时。尽管卷积神经网络在层次化特征学习方面取得了显著成功,但它们往往难以捕获多尺度上下文信息,且在面对噪声或无关图像区域时容易过拟合。本文提出RDCNet(基于随机稀疏卷积的图像分类网络),该新型架构基于ResNet-34,集成三项互为增益的创新,以解决上述局限性:(1) 多分支随机稀疏卷积(MRDC)模块,通过并行的不同膨胀率分支结合随机掩码机制,捕获跨多尺度的细粒度特征,同时增强对噪声和过拟合的鲁棒性;(2) 嵌入MRDC中的细粒度特征增强(FGFE)模块,通过自适应池化和双线性插值,将全局上下文信息与局部特征表示相结合,从而放大对细微视觉模式的敏感性;(3) 上下文激发(CE)模块,利用基于softmax的空间注意力和通道重校准,动态强化与任务相关的特征,抑制背景干扰。在CIFAR-10、CIFAR-100、SVHN、Imagenette和Imagewoof等五个基准数据集上的大量实验表明,RDCNet在所有数据集上均实现了状态最佳的分类准确率,分别比第二名的方法高出0.02%、1.12%、0.18%、4.73%和3.56%,从而验证了该方法在多样化视觉识别场景中的有效性和可推广性。
引用
@article{arxiv.2604.25188,
title = {Image Classification via Random Dilated Convolution with Multi-Branch Feature Extraction and Context Excitation},
author = {Wentao Jiang and Yuanchan Xu and Heng Yuan},
journal= {arXiv preprint arXiv:2604.25188},
year = {2026}
}