中文

语言模型表征引导的改进方法

计算与语言 2025-05-28 v1

摘要

语言模型(LM)的引导方法寻求通过 variously 改变模型输入、权重或表征来调整模型生成行为,以实现细粒度且可解释的控制。近期研究表明,调整权重或表征往往不如通过提示进行引导更有效,例如当想要引入或抑制特定概念时。我们展示了通过全新的 Reference-free Preference Steering(RePS)来改进表征引导的方法。RePS 是一种双向偏好优化目标,同时完成概念引导和抑制。我们训练了 RePS 的三个参数化形式,并在 AxBench 这一大型模型引导基准测试上对其进行评估。在 Gemma 模型(规模从 2B 到 27B)上,RePS 在所有使用语言建模目标训练的现有引导方法上均优于,并显著缩小了与提示方法之间的差距——同时促进可解释性并最小化参数数量。在抑制方面,RePS 在 Gemma-2 上与语言建模目标相当,在更大的 Gemma-3 变体上则优于该目标,并能抵抗那些击败提示方法的基于提示的攻击。总体而言,我们的结果表明,RePS 为引导和抑制提供了可解释且稳健的替代方案,无需依赖提示。

关键词

引用

@article{arxiv.2505.20809,
  title  = {Improved Representation Steering for Language Models},
  author = {Zhengxuan Wu and Qinan Yu and Aryaman Arora and Christopher D. Manning and Christopher Potts},
  journal= {arXiv preprint arXiv:2505.20809},
  year   = {2025}
}

备注

46 pages, 23 figures, preprint