中文

基于动态引导向量的语义自适应激活干预

计算与语言 2025-02-26 v2

摘要

大语言模型 (LLM) 在众多任务上取得了显著的性能,但在与期望行为对齐方面仍面临挑战。激活干预已成为一种有效且经济的方法,用于修改 LLM 的行为。尽管对该领域兴趣浓厚,但当前的干预方法仅使用固定的引导向量来修改模型激活,缺乏对不同输入语义的适应性。为此,我们提出了语义自适应动态干预 (SADI) 方法,通过在推理时构建动态引导向量来干预模型激活。具体而言,SADI 利用对比对中的激活差异,精准识别 LLM 中关键元素(即注意力头、隐藏状态和神经元)以进行针对性干预。在推理过程中,SADI 根据输入语义的方向对元素级激活进行比例调节,从而动态引导模型行为。实验结果表明,SADI 在 established baselines 上显著超越,显著提升任务性能且无需训练。SADI 的成本效益及其在各种 LLM 架构和任务上的通用性凸显了其作为一种通用对齐技术的潜力。

关键词

引用

@article{arxiv.2410.12299,
  title  = {Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors},
  author = {Weixuan Wang and Jingyuan Yang and Wei Peng},
  journal= {arXiv preprint arXiv:2410.12299},
  year   = {2025}
}