中文

利用对偶性解耦带修正线性单元的深层神经网络

机器学习 2021-10-08 v1

摘要

尽管取得了成功,深层神经网络(DNNs)仍很大程度上被视为黑箱。主要问题在于线性与非线性操作在每一层中都纠缠在一起,使得隐藏层输出难以解释。在本文中,我们考察带修正线性单元(ReLUs)的 DNN,并聚焦于 ReLUs 的门控特性(‘开/关’状态)。我们扩展了近期发展的对偶视角——其中计算按路径分解——以表明门中的学习更为关键,而在给定门下学习权重可通过所谓的神经路径核(NPK)解析刻画,NPK 依赖于输入与门。在本文中,我们给出新结果,表明带全局池化的卷积与跳跃连接分别为 NPK 提供旋转不变性与集成结构。为应对‘黑箱’性,我们提出一种带 ReLUs 的 DNN 的可解释对应物,即深度线性门控网络(DLGN):门的预激活由深度线性网络生成,然后门作为外部掩码应用于另一网络中学习权重。DLGN 本身并非一种替代架构,而是对带 ReLUs 的 DNN 中计算的解耦与可解释重排。DLGN 将计算解耦为两个‘数学上’可解释的线性:(i)门控网络中输入与预激活之间的‘原始’线性,以及(ii)由 NPK 刻画的权重网络路径空间中的‘对偶’线性。我们在 CIFAR-10 与 CIFAR-100 上比较 DNN、DGN 与 DLGN 的性能,表明 DLGN 恢复了最先进 DNNs 超过 83.5%83.5\% 的性能。这引出一个有趣问题:‘DLGN 是通用谱逼近器吗?’

关键词

引用

@article{arxiv.2110.03403,
  title  = {Disentangling deep neural networks with rectified linear units using duality},
  author = {Chandrashekar Lakshminarayanan and Amit Vikram Singh},
  journal= {arXiv preprint arXiv:2110.03403},
  year   = {2021}
}