E-TCAV:高效概念基可解释性的终端代理形式化
人工智能
2026-05-12 v1 机器学习
摘要
TCAV(Testing with Concept Activation Vectors,概念激活向量测试)是一种评估训练神经网络内部表示与人类可理解高层概念对齐程度的可解释性方法。尽管有效,但TCAV存在显著的计算开销、跨层TCAV分数不一致以及统计不稳定性问题。本工作通过深入调查TCAV方法的三个关键方面,引进E-TCAV以高效近似TCAV分数的框架:1)潜在分类器对TCAV分数稳定性的影响,2)TCAV分数的跨层一致性,3)将终端层作为早期层TCAV计算的快速代理。为确保E-TCAV的坚实基础,我们在四种不同的架构和五个数据集上进行了广泛评估,涵盖计算机视觉和自然语言处理领域的问题。我们的结果表明,神经网络最后一个块中的层在TCAV分数方面与终端层强烈一致,所观察到的TCAV分数方差可归因于潜在分类器的选择。利用这种跨层一致性以及终端层方向灵敏度退化,E-TCAV保证与网络规模和评估样本数量成线性比例的速度提升,标志着向高效模型调试和实时概念导向训练迈出了一步。
引用
@article{arxiv.2605.10261,
title = {E-TCAV: Formalizing Penultimate Proxies for Efficient Concept Based Interpretability},
author = {Hasib Aslam and Muhammad Ali Chattha and Muhammad Taha Mukhtar and Muhammad Imran Malik and Andreas Dengel and Sheraz Ahmed},
journal= {arXiv preprint arXiv:2605.10261},
year = {2026}
}