中文

澄清模型透明度:深度学习中的可解释性与可说明性——以 MNIST 和 IMDB 为例

机器学习 2025-09-16 v1 人工智能

摘要

深度学习模型的强大能力常常因其固有的不透明性而受到制约,这种不透明性通常被称为"黑箱"问题,阻碍了其在高信任领域的广泛应用。作为回应,可解释性与可说明性这两个交叉学科——统称为可解释人工智能(XAI)——已成为研究的焦点。尽管这些术语经常被用作同义词,但它们承载着不同的概念分量。本文件对深度学习范式中的可解释性与可说明性进行了比较性探讨,仔细阐述了它们各自的定义、目标、常见方法论和固有困难。通过对 MNIST 数字分类任务和 IMDB 情感分析的示例说明,我们论证了一个关键论点:可解释性通常涉及模型本身被人类理解其运行机制的能力(全局理解),而可说明性则更多地与旨在阐明模型单个预测或行为依据的后验技术相关(局部解释)。例如,特征归因方法可以揭示为什么特定的 MNIST 图像被识别为"7",词级重要性可以阐明 IMDB 情感分析的结果。然而,这些局部洞察并不能使复杂底层模型实现全局透明。正如这些标准数据集所展示的那样,对这一区别的清晰理解对于培养可靠和健全的人工智能至关重要。

关键词

引用

@article{arxiv.2509.10929,
  title  = {Clarifying Model Transparency: Interpretability versus Explainability in Deep Learning with MNIST and IMDB Examples},
  author = {Mitali Raj},
  journal= {arXiv preprint arXiv:2509.10929},
  year   = {2025}
}

备注

5 pages, 2 figures, Accepted at ICICC 2026