中文

靶向扰动揭示标准但不鲁棒的 ANN 脑模型中的类脑局部编码轴

神经元与认知 2025-09-30 v1 计算机视觉与模式识别 机器学习

摘要

人工神经网络(ANNs)因在预测神经反应方面的成功,已成为建模人类视觉系统的事实标准。然而,随着越来越多的模型实现相似的预测准确度,我们需要更严格的评估标准。本文使用小规模对抗探针来表征许多高预测精度 ANN 脑模型的局部表征几何。我们报告了四项关键发现。首先,我们证明大多数当代 ANN 脑模型意外地脆弱。尽管预测得分很高,但其响应预测对小幅不可感知扰动极其敏感,揭示了不可靠的局部编码方向。其次,我们证明模型对对抗探针的敏感性比预测准确度本身更能区分候选神经编码模型。第三,我们发现标准模型依赖于不同且不可迁移的局部编码方向。第四,我们表明来自鲁棒模型的对抗探针产生可泛化且语义上有意义的变化,表明它们捕捉到了视觉系统的局部编码维度。总体而言,本工作表明局部表征几何提供了更强的脑模型评估标准。我们也提供实证依据,支持选择鲁棒模型——其更稳定的编码轴不仅与神经选择性更好地一致,而且还为未来实验生成具体可测试的预测。

关键词

引用

@article{arxiv.2509.23333,
  title  = {Targeted perturbations reveal brain-like local coding axes in robustified, but not standard, ANN-based brain models},
  author = {Nikolas McNeal and N. Apurva Ratan Murty},
  journal= {arXiv preprint arXiv:2509.23333},
  year   = {2025}
}

备注

9 pages, 4 figures, preprint