中文

深度神经网络的结构解耦

计算机视觉与模式识别 2021-03-25 v2

摘要

理解深度神经网络(DNNs)的内部工作机制,对于为实际应用提供可信赖的人工智能技术至关重要。现有研究通常将语义概念与DNN的单元或层相关联,但未能解释推理过程。本文引入神经架构解耦(NAD)以填补这一空白。具体而言,NAD学习根据独立任务将预训练DNN解耦为子架构,形成描述推理过程的信息流。我们通过对手工设计和自动搜索的网络架构、以及基于对象和基于场景的数据集进行的实验,探究了解耦是否在发生、在何处发生以及以何种方式发生。基于实验结果,我们提出了三条提供DNN内部逻辑新见解的新发现。第一,DNN可划分为面向独立任务的子架构。第二,更深的层并不总是对应更高的语义。第三,DNN中的连接类型影响信息跨层流动的方式,导致不同的解耦行为。借助NAD,我们进一步解释了DNN有时给出错误预测的原因。实验结果表明,被误分类的图像极有可能被分配给与正确类别相似的任务子架构。代码将发布于:https://github.com/hujiecpp/NAD。

关键词

引用

@article{arxiv.2003.13268,
  title  = {Architecture Disentanglement for Deep Neural Networks},
  author = {Jie Hu and Liujuan Cao and Qixiang Ye and Tong Tong and ShengChuan Zhang and Ke Li and Feiyue Huang and Rongrong Ji and Ling Shao},
  journal= {arXiv preprint arXiv:2003.13268},
  year   = {2021}
}