中文

教导CNN模仿人类视觉认知过程并正则化纹理-形状偏置

计算机视觉与模式识别 2023-08-29 v2 人工智能 机器学习 图像与视频处理

摘要

计算机视觉近期实验表明,纹理偏置是采用卷积神经网络(CNN)的模型取得优异结果的主要原因,这与早期声称这些网络利用形状识别物体的工作相矛盾。人们认为代价函数迫使CNN采取贪婪策略,并对纹理等局部信息产生偏好以提升准确率,从而未能探索任何全局统计。我们提出CognitiveCNN,一种受心理学中特征整合理论启发的直观新架构,利用形状、纹理、边缘等人类可解释特征来重建并分类图像。我们定义新指标,利用注意力图量化这些模态中“抽象信息”的“相关性”。我们进一步引入一种正则化方法,确保给定任务中形状、纹理等各模态获得与其在重建中相称的影响;并开展实验表明由此带来的准确率与鲁棒性提升,此外还赋予这些CNN可解释性,以在物体识别中取得优越性能。

关键词

引用

@article{arxiv.2006.14722,
  title  = {Teaching CNNs to mimic Human Visual Cognitive Process & regularise Texture-Shape bias},
  author = {Satyam Mohla and Anshul Nasery and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2006.14722},
  year   = {2023}
}

备注

Submitted at ICASSP 2022; 5 Pages; LaTex;