LatentQA:教会大语言模型将激活解码为自然语言
计算与语言
2026-03-25 v2 计算机与社会
机器学习
摘要
自上而下的可解释性方法通常使用标量或单token输出的探针来分析语言模型激活,这限制了可捕获行为的范围。为缓解这一问题,我们开发了一种更具表达力的探针,可以直接输出自然语言,实现LatentQA:回答关于激活的开放式问题。开发此类探针的一个关键挑战是收集将激活映射到自然语言描述的数据集。为此,我们提出了一种生成激活与问答对数据集的方法,并开发了一种微调方法,用于在数据集上训练解码器大语言模型。然后,我们通过评估解码器读取和控制模型激活的能力来验证其保真度。首先,我们在多个具有已知答案的监督阅读任务上评估解码器,例如揭示隐藏的系统提示和关系抽取,观察到它优于现有的探针基线。其次,我们证明解码器能够精确地引导目标模型展现出训练中未见过的行为。最后,我们展示了LatentQA在数据集规模增大时具有良好的扩展性。
引用
@article{arxiv.2412.08686,
title = {LatentQA: Teaching LLMs to Decode Activations Into Natural Language},
author = {Alexander Pan and Lijie Chen and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2412.08686},
year = {2026}
}
备注
ICLR 2026; project page at https://latentqa.github.io