中文

激活预测师:作为通用激活解释器训练与评估大语言模型

计算与语言 2026-01-07 v2 人工智能 机器学习

摘要

大型语言模型(LLM)的激活值难以理解,大多数现有技术都使用复杂的、专门的方法进行解释。近期研究提出一种更简单的方法,称为LatentQA:训练LLM直接接受LLM激活值作为输入,并以自然语言回答关于它们的任意问题。然而,现有工作仅聚焦于狭窄的训练和评估情境。本文则从通用主义角度出发。我们评估了称为激活预测师(AOs)的LatentQA训练模型,在更广泛的分布外情境中进行测试,并检视性能随训练数据多样性的扩展情况。我们发现,AOs能够恢复被精调模型(例如生物信息知识或恶性倾向)深化而并不体现于输入文本中的信息,尽管从未使用精调模型的激活进行训练。我们的主要评估包括四个下游任务,可与先前的白盒和黑盒技术进行比较。我们发现,即使是狭窄训练的LatentQA模型也能良好泛化,添加额外的训练数据集(如分类任务和自监督上下文预测任务)可持续带来性能提升。我们的最佳AOs在所有四个任务上与白盒基线相当,并在三个任务上优于最佳整体基线。这些结果表明,针对自然语言查询进行多样化训练可赋予语言模型自言自语阐释LLM激活信息的通用能力。

关键词

引用

@article{arxiv.2512.15674,
  title  = {Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers},
  author = {Adam Karvonen and James Chua and Clément Dumas and Kit Fraser-Taliente and Subhash Kantamneni and Julian Minder and Euan Ong and Arnab Sen Sharma and Daniel Wen and Owain Evans and Samuel Marks},
  journal= {arXiv preprint arXiv:2512.15674},
  year   = {2026}
}

备注

36 pages