GradAttn:用任务调制注意力路径代替固定残差连接
计算机视觉与模式识别
2026-03-31 v1
摘要
深度卷积网络在网络深度增加时会出现梯度信号衰减,限制了在复杂架构中有效的特征学习。ResNet 通过残差连接缓解了这一问题,但这些固定的短路无法适应不同输入的复杂度,也无法在网络层级间有选择地强调任务相关特征。本研究引入 GradAttn,一种混合 CNN-Transformer 框架,用受注意力控制的梯度流代替固定残差连接。通过提取不同深度的多尺度 CNN 特征,并通过自注意力对其进行调节,GradAttn 在浅层纹理特征和深层语义表征之间动态加权。 For representational analysis, 我们在八个多样化数据集上评估了三个 GradAttn 变体,涵盖自然图像、医学影像和时尚识别。结果表明,GradAttn 在五个数据集上均优于 ResNet-18,FashionMNIST 上提升最高可达 +11.07% 准确率,同时保持相当的网络规模。梯度流分析揭示,注意力引入的受控不稳定性往往与改进的泛化能力相关,这挑战了“完美稳定性是最优”的假设。此外,位置编码的有效性显示出数据依赖性,其中 CNN 层级常编码足够的空间结构。这些发现表明,注意力机制可作为可学习梯度控制的 enabler,为深层神经网络架构中的自适应表征学习提供新范式。
引用
@article{arxiv.2603.26756,
title = {GradAttn: Replacing Fixed Residual Connections with Task-Modulated Attention Pathways},
author = {Soudeep Ghoshal and Himanshu Buckchash},
journal= {arXiv preprint arXiv:2603.26756},
year = {2026}
}
备注
14 pages, 5 figures. Under review