HOLE:用于神经网络可解释性的潜在嵌入同调观测
机器学习
2026-04-08 v3 图形学
人机交互
摘要
深度学习模型在各个领域取得了显著成功,然而它们学到的表征和决策过程在很大程度上仍然不透明且难以解释。本文介绍了HOLE(潜在嵌入的同调观测),一种通过持续同调分析和解释判别性神经网络的方法。HOLE从中间激活中提取拓扑特征,并使用一套可视化技术(包括聚类流图、团块图和热图树状图)进行展示。这些工具有助于检查各层表征的结构和质量。我们使用一系列判别性模型评估HOLE,重点关注表征质量、跨层可解释性以及对输入扰动和模型压缩的鲁棒性。结果表明,拓扑分析揭示了与类别分离、特征解耦和模型鲁棒性相关的模式,为理解和改进深度学习系统提供了一个补充视角。
引用
@article{arxiv.2512.07988,
title = {HOLE: Homological Observation of Latent Embeddings for Neural Network Interpretability},
author = {Sudhanva Manjunath Athreya and Paul Rosen},
journal= {arXiv preprint arXiv:2512.07988},
year = {2026}
}