激活 verbalization 方法是否传递特权信息?
计算与语言
2026-05-14 v4 机器学习
摘要
最近的可解释性方法提出将 LLM 内部表示翻译为自然语言描述,使用第二个 verbalizer LLM。这旨在阐明目标模型如何表示和处理输入。但,这些 activation verbalization 方法是否实际上提供关于目标模型内部工作的特权知识,或者仅仅传递关于提供给它的输入的信息?我们批判性地评估了流行的 verbalization 方法和数据集,发现无需访问目标模型内部即可在此类基准测试中取得好成绩,表明这些数据集不适合评估 verbalization 方法。随后,我们进行受控实验,发现 verbalization 往往反映的是生成 verbalizer LLM 的参数知识,而非被解码其激活的目标 LLM 的知识。总体而言,我们的结果表明需要针对 verbalization 方法是否提供对 LLMs 操作的有意义见解进行针对性基准和实验控制。
引用
@article{arxiv.2509.13316,
title = {Do Activation Verbalization Methods Convey Privileged Information?},
author = {Millicent Li and Alberto Mario Ceballos Arroyo and Giordano Rogers and Naomi Saphra and Byron C. Wallace},
journal= {arXiv preprint arXiv:2509.13316},
year = {2026}
}
备注
ICML 2026. 41 pages, 23 tables, 6 figures