中文

显式建模皮层下视觉并结合神经启发式前端可提升 CNN 鲁棒性

计算机视觉与模式识别 2025-10-30 v2 神经元与认知

摘要

在对象识别上训练的卷积神经网络(CNNs)虽能实现高任务性能,但与生物视觉相比,在一系列视觉扰动和域外图像下仍然表现出脆弱性。先前的研究已证明,将标准 CNN 与模拟灵长类初级视觉皮层(V1)的前端模块(VOneBlock)耦合,可以提升整体模型鲁棒性。在此基础上,我们引入了早期视觉网络(EVNets),一种新型混合 CNN,将 VOneBlock 与新颖的皮层下模块(SubcorticalBlock)相结合,其架构源自计算神经科学模型,并经参数化以最大化与多个实验研究中报告的皮层下响应的对齐。无需专门优化,VOneBlock 与 SubcorticalBlock 的组合在大多数标准 V1 基准测试上提升了 V1 对齐度,并更好地建模了外周感受野现象。此外,EVNets 展现出更强的涌现形状偏差,在包括对抗扰动、常见损坏和域偏移在内的鲁棒性评估聚合基准上比基础 CNN 架构高出 9.3%。最后,我们证明当 EVNets 与最先进的数据增强技术配对时,可进一步提升性能,在我们的鲁棒性基准上比孤立的数据增强方法高出 6.2%。这一结果揭示了更好地模拟生物学的架构变化与基于训练机器学习方法之间的互补益处。

关键词

引用

@article{arxiv.2506.03089,
  title  = {Explicitly Modeling Subcortical Vision with a Neuro-Inspired Front-End Improves CNN Robustness},
  author = {Lucas Piper and Arlindo L. Oliveira and Tiago Marques},
  journal= {arXiv preprint arXiv:2506.03089},
  year   = {2025}
}