中文

偏移梯度:理解防御性训练方法如何保护语言模型的完整性

机器学习 2026-04-21 v1 人工智能

摘要

防御性训练方法,如积极预防性引导(PPS)和预防性提示(IP),通过看似相似的过程展现出惊人的效果:它们在训练期间向大型语言模型(LLMs)中添加特征诱导对象,两者都能防御LLM获取该特征。这些方法的惊人成功引发了一个问题:它们是如何工作的?PPS和IP是否在做同样的事情?我们以“邪恶性”为案例研究特征,对这两种方法进行行为和机制比较。我们的核心发现是,PPS和IP通过不同的机制实现其防御性益处。行为上,我们表明, neither PPS nor IP operate through a purely associative mechanism;并且PPS不仅能防御特征获取,还能主动减少既有表达,而IP在先前微调以表达该特征的模型中无效。这种行为差异在机制上得到体现:PPS将激活梯度偏向于沿PPS向量轴的抑制方向。当PPS向量与特征表达轴对齐时,它可以反转梯度压力,减少而非增加该轴上的激活。相比之下,IP缺乏精确的机制描述。直接的余弦相似性分析揭示,IP的梯度特征与PPS不同,定性分析显示IP的梯度更为扩散。此外,IP在特征表达数据上的下一个标记预测损失上具有优势,而PPS不必如此,这一致与IP“解释掉”训练数据中特征表达的概念。综合来看,我们的分析揭示了每种方法的不同操作机制,并突显了关于IP机制图景的开放问题。

关键词

引用

@article{arxiv.2604.16423,
  title  = {Shifting the Gradient: Understanding How Defensive Training Methods Protect Language Model Integrity},
  author = {Satchel Grant and Victor Gillioz and Jake Ward and Thomas McGrath},
  journal= {arXiv preprint arXiv:2604.16423},
  year   = {2026}
}