深度神经网络中信息流的建模
机器学习
2017-12-04 v1 机器学习
摘要
本文提出一种针对深度神经网络结构(如卷积神经网络(CNN))分类任务的基于信息论的原理性分析。卷积滤波器的输出被建模为以对象类别 C 和网络滤波器组 F 为条件的随机变量 Y。条件熵(CENT)H(Y |C,F) 在理论与实验中均被证明是一种高度紧凑且具类别判别性的编码,它可从已有 CNN 各层的滤波器输出计算得出,并用于获得高于原 CNN 本身的分类结果。实验在两个独立的 CNN 分类场景中证明了 CENT 特征分析的有效性。1)在根据 3D 磁共振图像(MRI)体数据对阿尔茨海默病(AD)神经退行化与自然衰老进行分类时,3 个 CENT 特征在全体脑 AD 分类上达到 AUC=94.6%,为所用公开 OASIS 数据集上报道的最高精度,且比该任务下训练所得原 CNN 的 softmax 输出高 12%。2)在根据 2D 照片进行视觉对象分类时,基于在已有 CNN 中识别出的少量 CENT 特征进行迁移学习,在对先前未见过的对象类别分类时得到的 AUC 值可与原始网络 1000 维 softmax 输出相当。该通用信息论分析解释了近期多种 CNN 设计成功案例(如密集连接 CNN 架构),并为深度学习未来研究方向提供了见解。
引用
@article{arxiv.1712.00003,
title = {Modeling Information Flow Through Deep Neural Networks},
author = {Ahmad Chaddad and Behnaz Naisiri and Marco Pedersoli and Eric Granger and Christian Desrosiers and Matthew Toews},
journal= {arXiv preprint arXiv:1712.00003},
year = {2017}
}