中文

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

人工智能 2026-03-20 v1

摘要

语言模型在内部表示中编码的任务相关知识远远超过其输出性能,但机制可解释性方法是否能够桥接这种知识-行动鸿沟尚未进行系统性测试。我们比较了四种机制可解释性方法——概念瓶颈驾驭(Steerling-8B)、稀疏自编码器特征驾驭、logit镜头配合激活修补以及线性探测结合truthfulness分离向量驾驭(Qwen 2.5 7B Instruct)——用于纠正false-negative triage错误,使用400个医生审核的临床案例(144例危险,256例良性)。线性探测器对危险情况和良性情况的AUROC为98.2%,但模型的输出灵敏度仅为45.1%,达到了53个百分点的知识-行动鸿沟。概念瓶颈驾驭纠正了20%的漏检危险,但扰乱了53%的正确检测,与随机扰动(p=0.84)无异。稀疏自编码器特征驾驭虽然发现了3,695个显著特征,但未产生任何效果。TSV驾驭在高强度下纠正了24%的漏检危险,扰乱了6%的正确检测,但仍遗漏了76%的错误。当前的机制可解释性方法无法可靠地将内部知识转化为纠正的输出,这对那些假设可解释性能够实现有效错误纠正的AI安全框架产生了启示。

关键词

引用

@article{arxiv.2603.18353,
  title  = {Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations},
  author = {Sanjay Basu and Sadiq Y. Patel and Parth Sheth and Bhairavi Muralidharan and Namrata Elamaran and Aakriti Kinra and John Morgan and Rajaie Batniji},
  journal= {arXiv preprint arXiv:2603.18353},
  year   = {2026}
}

备注

27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage