激活占位符的置信度与校准: 面向可靠语言模型内部解释的框架
计算与语言
2026-05-26 v1 人工智能
摘要
激活占位符旨在使其他模型的激活对人类可读, 并与白盒解释技术相比取得良好结果。然而, 对于此类激活占位符自然语言输出的不确定性量化 (UQ) 至今鲜有研究。本文调查了 6 种用于估计激活占位符置信度的方法, 并评估其置信度得分是否 well-calibrated。我们对 6,000 个样本进行实验 (各激活占位符不同 verbalizer 和 context 提示), 发现 bootstrap 模式频率是测试中最 well-calibrated的方法 (ECE 5.7% vs. 25.5% for answer-word log-probability on Qwen3-8B; 10.3% vs. 13.1% on Qwen3.6-27B), log-prob 基线可作为快速分流信号, 成本仅为原来的一小部分。代码和已修补的 trainer 可在 https://github.com/federicotorrielli/probabilistic_activation_oracles 获取。
引用
@article{arxiv.2605.26045,
title = {Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals},
author = {Federico Torrielli and Peter Schneider-Kamp and Lukas Galke Poech},
journal= {arXiv preprint arXiv:2605.26045},
year = {2026}
}