MEUV:通过互斥解锁向量实现大语言模型的细粒度能力激活
机器学习
2025-09-17 v1 人工智能
计算与语言
密码学与安全
摘要
大型语言模型(LLM)实施了安全对齐以可靠地拒绝恶意请求,然而这些一刀切的安全防护措施也阻碍了在执法、国防和其他高风险环境中的合法使用。早期的“拒绝方向”编辑可以绕过这些防护层,但它们依赖于单一向量,会不加区分地解锁所有危险主题,无法提供语义控制。我们引入了互斥解锁向量(MEUV),一个轻量级框架,将整体性的拒绝方向分解为与主题对齐且近乎正交的向量,每个向量专用于一种敏感能力。MEUV 通过多任务目标在单个 epoch 内学习完成,该目标融合了差分消融间隔、跨主题与正交性惩罚以及若干辅助项。在双语恶意提示基准测试中,MEUV 在 Gemma-2-2B、LLaMA-3-8B 和 Qwen-7B 上实现了不低于 87% 的攻击成功率,且与最佳的单方向基线相比,将跨主题泄漏减少了高达 90%。在中文上训练的向量几乎原样迁移至英文(反之亦然),表明存在一个与语言无关的拒绝子空间。结果表明,在效用损失极小的情况下实现细粒度、主题级的能力激活是可行的,为在安全敏感领域部署受控的 LLM 铺平了道路。
引用
@article{arxiv.2509.12221,
title = {MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors},
author = {Xin Tong and Zhi Lin and Jingya Wang and Meng Han and Bo Jin},
journal= {arXiv preprint arXiv:2509.12221},
year = {2025}
}
备注
Under Review