LINE:基于 LLM 的迭代神经元解释方法
计算机视觉与模式识别
2026-05-14 v2 人工智能
机器学习
摘要
解释深度神经网络中单个神经元的决策过程是理解其复杂决策机制并确保 AI 安全的关键步骤。尽管近期在神经元标记方面取得了进展,但现有方法常将搜索空间限制在预定义的概念词汇表内,或生成过于具体的描述,难以捕捉更高阶的全局概念。我们提出了 LINE,即一种针对视觉模型的开放词汇概念标记的新型、无需训练的迭代方法。在严格的黑箱设置下,LINE 利用大语言模型和文本到图像生成器,在闭环中引导激活历史,不断提议并细化概念。LINE 在多个模型架构上实现了最先进的性能,在 ImageNet 上 AUC 提升最高可达 0.11,在 Places365 上提升 0.05,同时平均发现 27% 的预定义词汇遗漏的新概念。除了识别顶级概念外,LINE 提供完整的生成历史,使其能够进行多义性评估,并生成与梯度依赖的激活最大化方法相似的可视化解释。源代码将很快公开。
引用
@article{arxiv.2604.08039,
title = {LINE: LLM-based Iterative Neuron Explanations for Vision Models},
author = {Vladimir Zaigrajew and Michał Piechota and Gaspar Sekula and Paweł Gelar and Przemysław Biecek},
journal= {arXiv preprint arXiv:2604.08039},
year = {2026}
}