通过激活稀疏性在卷积神经网络中涌现形状偏置
计算机视觉与模式识别
2023-10-31 v1
摘要
当前用于物体识别的深度学习模型已知严重偏向于纹理。相比之下,人类视觉系统已知偏向于形状与结构。人类视觉系统中导致这一差异的设计原理可能是什么?我们如何向深度学习模型中引入更多的形状偏置?在本文中,我们报告称稀疏编码——大脑中一种普遍存在的原理——其本身就能将形状偏置引入网络。我们发现,使用不可微的 Top-K 操作强制稀疏编码约束,可导致卷积神经网络中神经元结构编码的涌现,实现对物体到部件与子部件的平滑分解,并赋予网络形状偏置。我们在不同网络结构与多个数据集上展示了这种形状偏置的涌现及其功能益处。对于物体识别卷积神经网络,形状偏置带来针对风格与图案变化干扰更强的鲁棒性。对于图像合成生成对抗网络,涌现的形状偏置导致合成图像中具有更连贯且可分解的结构。消融研究表明,稀疏编码倾向于编码结构,而更分布式的编码倾向于偏好纹理。我们的代码托管于 github 仓库:\url{https://github.com/Crazy-Jack/nips2023_shape_vs_texture}
引用
@article{arxiv.2310.18894,
title = {Emergence of Shape Bias in Convolutional Neural Networks through Activation Sparsity},
author = {Tianqin Li and Ziqi Wen and Yangfan Li and Tai Sing Lee},
journal= {arXiv preprint arXiv:2310.18894},
year = {2023}
}
备注
Published as NeurIPS 2023 (Oral)