基于生成式因果中介的激活引导
计算与语言
2026-04-02 v2 计算机与社会
人机交互
机器学习
摘要
在语言模型(LM)中,针对分布在长回复多个 token 上的行为,从何处干预以局部化和控制这些行为?我们提出生成式因果中介(GCM),一种从对比长形式回复中选择模型组件(如注意力头)来引导此类扩散概念(如诗歌 vs. 散文)的程序。在 GCM 中,我们首先构建对比行为输入与长形式回复的数据集。随后量化模型组件如何中介该概念,并为引导选择最强中介者。我们在三个行为——拒绝、顺从与风格转换——以及三个语言模型上评估 GCM。GCM 成功局部化长形式回复中表达的概念,并在稀疏注意力头引导时优于基于相关性探针的基线方法。这些结果表明,GCM 提供了一种有效的方法,用于从长形式 LM 回复中局部化并进行控制。
引用
@article{arxiv.2602.16080,
title = {Activation Steering via Generative Causal Mediation},
author = {Aruna Sankaranarayanan and Amir Zur and Atticus Geiger and Dylan Hadfield-Menell},
journal= {arXiv preprint arXiv:2602.16080},
year = {2026}
}