探针之探针:概念对齐的方法与指标
人工智能
2025-11-07 v1
摘要
在可解释人工智能领域,概念激活向量 (CAV) 通常通过训练线性分类探针来检测人类可理解概念作为深度神经网络激活空间中的方向。人们普遍假设,高探针准确率表明 CAV 忠实地表示其目标概念。然而,我们指出,探针的分类准确率本身是不可靠的概念对齐度量标准,即 CAV 捕获其预期概念的程度。事实上,我们认为探针更可能捕获虚假关联,而非仅表示其预期概念。作为分析的一部分,我们演示了通过刻意构建的误差探针(旨在利用虚假关联)可实现接近标准探针的准确率。为解决这一严重问题,我们引入一种基于空间线性归因的新型概念局部分析方法,并对其进行与现有特征可视化技术的全面比较,以检测和缓解概念误差。我们进一步提出三类用于定量评估概念对齐的指标:硬准确率、分割得分和数据增强鲁棒性。我们的分析表明,具有平移不变性和空间对齐性的探针在概念对齐方面表现更佳。这一发现凸显了需要基于对齐度的评估指标而非探针准确率的重要性,以及针对模型体系结构和目标概念本质性质调整探针的必要性。
引用
@article{arxiv.2511.04312,
title = {Probing the Probes: Methods and Metrics for Concept Alignment},
author = {Jacob Lysnæs-Larsen and Marte Eggen and Inga Strümke},
journal= {arXiv preprint arXiv:2511.04312},
year = {2025}
}
备注
29 pages, 17 figures