面向平移不变卷积神经网络的参数高效架构修改
计算机视觉与模式识别
2026-05-01 v1
摘要
卷积神经网络(CNN)被广泛认为具有平移不变性,然而标准架构却表现出惊人的脆弱性:由于依赖空间相关的全连接层,即使单像素偏移也能显著降低性能。在这项工作中,我们通过提出一种轻量级的“在线架构”策略来解决这一脆弱性。通过在不同网络深度策略性地插入全局平均池化(GAP)层,我们有效地将特征识别与空间位置解耦。以 VGG-16 作为主要案例研究,我们证明这种架构修改实现了可训练参数大幅减少 98%(从 5.2M 降至仅 82K),总网络规模减少 90%(从 138M 降至 14M)。尽管进行了如此大幅度的剪枝,我们的变体在 ImageNet 上仍保持了有竞争力的 Top-1 准确率(66.4%),同时将平移鲁棒性提高了一倍,将平均相对损失从 0.09 降至 0.05。此外,我们的分析确定了不变性的一个基本限制:虽然 GAP 解决了宏观敏感性,但离散池化操作引入了残余的周期性混叠,阻碍了完美的像素级稳定性。最后,我们通过将不变性骨干网络集成到 LPIPS 框架中,将这些发现扩展到感知图像质量评估(IQA)。由此产生的指标在 KADID-10k 数据集上的泛化能力显著优于重新训练的基线(Spearman 相关系数 0.89 对比 0.75),并在 RAID 数据集上实现了与人类心理物理响应曲线近乎完美的对齐(Spearman 相关系数 0.95)。这些结果证实,强制架构不变性是比传统数据增强更高效且更具生物学合理性的鲁棒性路径。数据和代码已公开。
引用
@article{arxiv.2604.27870,
title = {Parameter-Efficient Architectural Modifications for Translation-Invariant CNNs},
author = {Nuria Alabau-Bosque and Jorge Vila-Tomas and Paula Dauden-Oliver and Valero Laparra and Jesus Malo},
journal= {arXiv preprint arXiv:2604.27870},
year = {2026}
}
备注
25 pages, 16 figures