迈向透明AI:深度神经网络内部结构解释综述
机器学习
2023-08-22 v6 人工智能
计算与语言
计算机视觉与模式识别
摘要
过去十年的机器学习在规模与能力上经历了急剧增长。深度神经网络(DNNs)正日益部署于现实世界中。然而,它们难以分析,引发了在缺乏对其运作机制的严格理解下使用的担忧。有效的解释工具将通过帮助识别问题、修复缺陷和提升基础认知,对构建更可信的AI至关重要。特别是聚焦于解释DNN内部组件的“内部”可解释性技术,非常适合于发展机制性理解、指导手动修改以及逆向工程解决方案。近期大量工作聚焦于DNN可解释性,快速进展迄今已使方法的全面系统化变得困难。本综述回顾了300余篇文献,重点关注内部可解释性工具。我们引入了一种分类法,按其所助解释的网络部分(权重、神经元、子网络或潜在表示)以及是在训练中(内在)还是训练后(事后)实现来分类方法。据我们所知,我们也首次综述了可解释性研究与对抗鲁棒性、持续学习、模块化、网络压缩及人眼视觉系统研究之间的若干联系。我们讨论了关键挑战,并指出当前可解释性研究的现状在很大程度上缺乏成效。最后,我们强调了未来工作应关注诊断、调试、对抗样本与基准测试,以使可解释性工具对实际应用中的工程师更为有用。
引用
@article{arxiv.2207.13243,
title = {Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks},
author = {Tilman Räuker and Anson Ho and Stephen Casper and Dylan Hadfield-Menell},
journal= {arXiv preprint arXiv:2207.13243},
year = {2023}
}