中文

模仿人类视觉发展以学习鲁棒的图像表征

计算机视觉与模式识别 2025-12-17 v1

摘要

人类视觉系统在适应输入分布变化方面具有惊人的能力;这一能力现代卷积神经网络(CNN)仍难以匹配。以人类视觉发育轨迹为灵感,我们提出了一种渐进模糊课程以提高CNN的泛化能力和鲁棒性。人类婴儿出生时视力较差,逐渐 refinement 其感知细节能力。仿照这一过程,我们在初始训练周期对高度模糊的图像进行训练,并逐渐减少模糊程度。这种方法鼓励网络优先关注全局结构而非高频细节,提高了对分布迁移和噪声输入的鲁棒性。我们挑战了关于在初始训练阶段使用模糊会造成感官缺失并不可逆损害模型性能的先前观点,揭示了早期阶段的模糊处理实际上能提升泛化能力,仅对领域内准确率产生最小影响。我们的实验表明,与标准训练相比,所提出的课程在 CIFAR-10-C 上将平均损坏误差(mCE)降低最高可达 8.30%,在 ImageNet-100-C 上降低 4.43%。不同于静态模糊数据增强方法,该方法在整个训练过程中随机应用模糊图像,而本方法遵循结构化的进度,各数据集均实现一致的性能提升。此外,我们的方法可与其他数据增强技术(如 CutMix 和 MixUp)相结合,增强自然鲁棒性及常见攻击方法的对抗鲁棒性。代码已公开于 https://github.com/rajankita/Visual_Acuity_Curriculum。

关键词

引用

@article{arxiv.2512.14360,
  title  = {Mimicking Human Visual Development for Learning Robust Image Representations},
  author = {Ankita Raj and Kaashika Prajaapat and Tapan Kumar Gandhi and Chetan Arora},
  journal= {arXiv preprint arXiv:2512.14360},
  year   = {2025}
}

备注

Accepted to ICVGIP 2025