中文

Llama 2 模型与拒绝机制的激活导向比例定律

机器学习 2025-07-17 v1

摘要

随着大型语言模型(LLM)在复杂性和能力方面的不断发展,较少部署的对齐技术的有效性面临不确定性。本文在先前关于激活引导和对比度激活添加(CAA)方面的工作基础上,探讨了使用Llama 2模型(7B、13B和70B)的CAA有效性。CAA通过使用对比对(例如,从恐惧到爱情)找到模型残差流向量空间中的可取"方向",并在前向传递期间将此方向添加到残差流中。它直接操控残差流,旨在从语言模型中提取特征,以更好地控制其输出。使用围绕拒绝行为的答案匹配问题,我们发现:1)CAA在早中层应用最为有效。2)随模型大小的增加,CAA的有效性会下降。3)在所有模型大小下,负向引导的影响比正向引导更为显著。

关键词

引用

@article{arxiv.2507.11771,
  title  = {Scaling laws for activation steering with Llama 2 models and refusal mechanisms},
  author = {Sheikh Abdur Raheem Ali and Justin Xu and Ivory Yang and Jasmine Xinze Li and Ayse Arslan and Clark Benham},
  journal= {arXiv preprint arXiv:2507.11771},
  year   = {2025}
}