中文

解锁噪声抗性视觉:强鲁棒模型的关键架构秘密

计算机视觉与模式识别 2025-09-26 v1 机器学习

摘要

虽然视觉模型的鲁棒性常被衡量,但其对特定架构设计选择的依赖却鲜有剖析。我们研究了为何某些视觉架构对加性高斯噪声天然更具鲁棒性,并将这些经验性见解转化为简单、可操作的设计规则。具体而言,我们对 1,174 个预训练视觉模型进行了广泛评估,经验性地识别出四项改善高斯噪声鲁棒性的一致设计模式:更大的 stem 内核、较小的输入分辨率、平均池化以及使用受监督的视觉转换器(ViT)而非 CLIP ViT,这可实现最高 506 名排名提升和 21.6% 的准确率提升。我们随后开发了理论分析,解释了这些发现,将观察到的相关性转化为因果机制。首先,我们证明了低通滤波 stem 内核可通过内核大小的平方衰减来衰减噪声;反锯齿下采样大致按下采样因数的平方来降低噪声能量。其次,我们展示了平均池化是无偏且可按池化窗口面积抑制噪声的,而最大池化则会随窗口大小缓慢增加正偏差,并产生较高的均方误差和更大的最坏情况灵敏度。再者,我们揭示了 CLIP ViT 的脆弱性,通过像素空间 Lipschitz 界限:CLIP 预处理中使用的较小标准差会放大最坏情况灵敏度最高可达 1.91 倍。我们的结果整体上将鲁棒性解构为可解释的模块,提供解释观察趋势的理论,并为设计更抗高斯噪声的视觉模型提供实用、即插即用的指南。

关键词

引用

@article{arxiv.2509.20939,
  title  = {Unlocking Noise-Resistant Vision: Key Architectural Secrets for Robust Models},
  author = {Bum Jun Kim and Makoto Kawano and Yusuke Iwasawa and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2509.20939},
  year   = {2025}
}

备注

30 pages, 5 figures