中文

最小化激活引导的 collateral damage

机器学习 2026-05-05 v1 人工智能

摘要

激活引导是一种通过干扰大语言模型(LLM)内部表征来控制其行为的方法,以增加其与特定目标特征方向的对齐。然而,标准干预(如向量相加)常导致collateral damage,即对非目标特征方向对对齐的意外改变。这种损伤源于标准方法隐含假设非目标特征呈各向同性。本文对collateral damage进行数学形式化建模,并引入一种原则化框架,将引导建模为受约束的优化问题。该方法寻找新的激活值,以最小化其在经验二阶矩矩阵加权下的预期平方collateral change。这种加权编码了不同特征方向上扰动的非均匀成本,与对所有特征方向均匀惩罚的各向同性方法形成对比。通过考虑激活的经验二阶矩,本方法实现了更精确的控制,同时降低了对无关任务模型性能的降解。

关键词

引用

@article{arxiv.2605.01167,
  title  = {Minimizing Collateral Damage in Activation Steering},
  author = {Tam Nguyen and Tu Anh Nguyen and Sina Alemohammad and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:2605.01167},
  year   = {2026}
}