中文

对大语言模型的非线性干预

计算与语言 2026-05-15 v1 人工智能 机器学习

摘要

干预是理解大语言模型(LLM)内部表征最具代表性且最广泛使用的方法之一。然而,现有的干预方法局限于基于线性表征假说的线性干预,使得沿非线性流形编码的特征超出了其能力范围。在本工作中,我们引入了一种干预的一般公式表述,可自然地扩展到非线性表示的特征,同时配备了一种学习过程,进一步实现了对缺乏直接输出特征的隐式特征的干预。我们在拒绝绕过引导上验证了我们的框架,通过干预控制拒绝的非线性特征,它比线性基线更精确地引导了模型。

关键词

引用

@article{arxiv.2605.14749,
  title  = {Non-linear Interventions on Large Language Models},
  author = {Sangwoo Kim},
  journal= {arXiv preprint arXiv:2605.14749},
  year   = {2026}
}