中文

REAL:读取 Transformer 激活值以实现语言模型引导中的精确定位

计算与语言 2025-10-02 v2

摘要

推理时引导旨在在不改变大型语言模型(LLM)参数的情况下改变其响应,但核心挑战在于识别最强烈控制目标行为的内部模块。现有方法通常依赖简单化的线索或临时启发式方法,导致次优或意外效果。我们引入了 REAL,一个用于识别 Transformer 模型中行为相关模块(注意力头或层)的框架。对于每个模块,REAL 在其隐藏激活上训练一个向量量化自编码器(VQ-AE),并使用一个共享的、可学习的码本将潜在空间划分为行为相关和行为无关的子空间。REAL 通过其 VQ-AE 编码在二元分类度量下区分行为对齐响应与行为违背响应的能力,来量化模块的行为相关性;该分数同时指导模块选择和引导强度。我们在来自 Llama 和 Qwen 家族的八个 LLM 以及涵盖真实性增强、知识冲突下的开放域问答和通用对齐任务的九个数据集上对 REAL 进行了评估。REAL 实现了更有效的推理时干预,在真实性引导上相比 ITI 方法平均实现了 20%(最高达 81.5%)的相对提升。此外,REAL 选择的模块在跨域真实性引导场景中表现出强大的零样本泛化能力。

关键词

引用

@article{arxiv.2506.08359,
  title  = {REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering},
  author = {Li-Ming Zhan and Bo Liu and Chengqiang Xie and Jiannong Cao and Xiao-Ming Wu},
  journal= {arXiv preprint arXiv:2506.08359},
  year   = {2025}
}

备注

Preprint