通过猴视觉皮层多任务学习迈向鲁棒视觉
计算机视觉与模式识别
2021-12-21 v3 人工智能
机器学习
摘要
深度神经网络在计算机视觉的许多任务上树立了最先进水平,但其对图像失真的泛化能力却出奇地脆弱。相比之下,哺乳动物视觉系统对大范围的扰动具有鲁棒性。近期研究表明,这种泛化能力可由视觉皮层中编码的视觉刺激表征所含的有用归纳偏置来解释。在此,我们借助多任务学习方法成功利用了这些归纳偏置:我们联合训练了一个深度网络以执行图像分类并预测猕猴初级视觉皮层(V1)的神经活动。我们通过测试网络对图像失真的鲁棒性来度量其分布外泛化能力。我们发现,尽管训练中没有这些失真,在猴V1数据上的协同训练仍提升了鲁棒性。此外,我们表明我们网络的鲁棒性与一个Oracle网络非常接近,后者部分架构直接在含噪图像上训练。我们的结果还表明,随着鲁棒性提升,网络的表征变得更像大脑。利用一种新颖的约束重构分析,我们探究了是什么使我们的脑正则化网络更鲁棒。我们发现,与仅训练图像分类的基线网络相比,我们的协同训练网络对内容比噪声更敏感。利用ImageNet图像的DeepGaze预测显著性图,我们发现我们的猴协同训练网络往往对场景中的显著区域更敏感,令人联想到关于V1在物体边界和自下而上显著性检测中作用的现有理论。总体而言,我们的工作拓展了从大脑迁移归纳偏置这一有前景的研究方向,并对迁移效果提供了新颖的分析。
引用
@article{arxiv.2107.14344,
title = {Towards robust vision by multi-task learning on monkey visual cortex},
author = {Shahd Safarani and Arne Nix and Konstantin Willeke and Santiago A. Cadena and Kelli Restivo and George Denfield and Andreas S. Tolias and Fabian H. Sinz},
journal= {arXiv preprint arXiv:2107.14344},
year = {2021}
}
备注
NeurIPS 2021 camera ready (final)