中文

通过能量校准的多适配器表示干预

人工智能 2026-05-28 v1

摘要

表示干预已成为一种新兴的范式,用于在不修改模型权重的情况下将大语言模型对齐到所需行为。现有方法通常对所有输入应用固定的干预。然而,我们发现,干预方向和强度在不同样本之间差异很大,而这种不成文的干预会导致对良性输入上常规能力的降低。为解决这些挑战,我们提出了通过能量校准实现的多适配器表示干预(MARI)。具体而言,我们在其中引入了竞争式的多适配器机制,使专用专家能够捕捉非线性校正模式,并自适应地确定不同样本的适当干预方向和强度。此外,我们设计了基于能量的门控模块,利用内部传播动力学来区分适用于干预的输入。广泛的实验在不同的模型家族和参数规模上表明,MARI 实现了对齐性能的领先水平。我们的方法在 TruthfulQA、BBQ 和安全基准测试中显著提升了性能,同时在诸如 MMLU 和 ARC 等任务上保持甚至提升了常规能力。我们的代码已提供:https://github.com/V1centNevwake/MARI。

关键词

引用

@article{arxiv.2605.28722,
  title  = {Multi-Adapter Representation Interventions via Energy Calibration},
  author = {Manjiang Yu and Hongji Li and Junwei Chen and Xue Li and Priyanka Singh and Yang Cao and Lijie Hu},
  journal= {arXiv preprint arXiv:2605.28722},
  year   = {2026}
}

备注

Accepted by ICML 2026