基于最优传输的 LLM 高效拒绝消除
机器学习
2026-03-05 v1 人工智能
摘要
安全对齐的语言模型通过编码在其内部表示中的学习拒绝行为来拒绝有害请求。最近的基于激活的攻击方法通过对拒绝方向应用正交投影来规避这些安全机制,但这些方法将拒绝视为一维现象,忽略了模型激活分布结构。我们引入一种基于最优传输理论的原则框架,将有害激活的整个分布转换为无害激活。通过将 PCA 与闭形式高斯最优传输相结合,我们在保持关键几何结构的同时,在高维表示空间中实现高效计算。我们的方法在 6 个模型(Llama-2、Llama-3.1、Qwen-2.5;参数范围 7B-32B)上实现比最先进基准最高 11% 的攻击成功率,同时保持可比的 perplexity,表明在保持模型能力方面效果更佳。关键的是,我们发现层选择性干预(在大约 40-60% 网络深度的 1-2 个精心挑选的层上应用最优传输)显著优于整个网络干预,这表明拒绝机制可能是局部化的而非分布式的。我们的分析为理解安全表示的几何结构提供了新见解,并表明当前对齐方法可能面临超出简单方向消除之外的分布攻击。
关键词
引用
@article{arxiv.2603.04355,
title = {Efficient Refusal Ablation in LLM through Optimal Transport},
author = {Geraldin Nanfack and Eugene Belilovsky and Elvis Dohmatob},
journal= {arXiv preprint arXiv:2603.04355},
year = {2026}
}