利用深度神经网络学习视觉概念与算子词汇表的研究
计算机视觉与模式识别
2021-09-02 v1
摘要
深度神经网络已成为图像和视频识别、分割以及其他图像和视频相关任务等许多应用的首选。然而,这些模型的一个关键挑战是缺乏可解释性。这种生成可解释预测的需求促使研究界对训练好的模型进行各种分析。在本研究中,我们使用 MNIST 图像分析训练模型所学到的特征图,以实现更具可解释性的预测。我们的研究侧重于推导一组基元元素(此处称为视觉概念),这些元素可用于从数据生成分布中生成任意样本。我们从模型学到的特征图中推导出这些基元元素。我们通过从使用 MNIST 图像训练的变分自编码器(Variational Autoencoder)中生成视觉概念来说明这一想法。我们通过添加约 60,000 张由随机选择的视觉概念生成的新图像来扩充 MNIST 数据集的训练数据。借此,我们能够将重建损失(均方误差)从未经扩充时的初始值 120 降低到经扩充后的 60。我们的方法是实现最终目标的第一步,即获得训练好的深度神经网络模型,其预测、隐藏层中的特征以及所学滤波器都能得到良好解释。这样的模型在部署到生产环境时可以轻松修改以适应新数据,而现有的深度学习模型需要重新训练或微调。这一过程又需要大量不易生成的数据样本,除非模型具有良好的可解释性。
引用
@article{arxiv.2109.00479,
title = {Towards Learning a Vocabulary of Visual Concepts and Operators using Deep Neural Networks},
author = {Sunil Kumar Vengalil and Neelam Sinha},
journal= {arXiv preprint arXiv:2109.00479},
year = {2021}
}