中文

LED-Merging: 利用 Location-Election-Disjoint 缓解模型合并中的安全-效用冲突

计算与语言 2025-08-15 v2 人工智能

摘要

针对特定任务微调预训练大型语言模型(LLMs)会产生大量的计算和数据成本。虽然模型合并提供了一种无需训练即可集成多个特定任务模型的解决方案,但现有方法存在安全-效用冲突,即增强的通用能力会降低安全防护。我们识别出两个根本原因:由于仅基于参数幅度的简单选择导致的神经元误识别\textbf{神经元误识别},以及合并过程中的跨任务神经元干扰\textbf{跨任务神经元干扰}。为了应对这些挑战,我们提出了LED-Merging\textbf{LED-Merging},这是一个三阶段框架,通过基于梯度的归因定位\textbf{定位}(Locate)特定任务神经元,通过多模型重要性融合动态选举\textbf{选举}(Elect)关键神经元,并通过参数隔离分离\textbf{分离}(Disjoint)冲突的更新。在 Llama-3-8B、Mistral-7B 和 Llama2-13B 上的大量实验表明,LED-Merging 有效降低了有害响应率,在 HarmBench 上 Llama-3-8B-Instruct 的有害响应率降低了 31.4%,同时保留了 95% 的效用性能,例如在 GSM8K 上实现了 52.39% 的准确率。LED-Merging 解决了安全-效用冲突,并为构建可靠的多任务 LLMs 提供了一种轻量级、无需训练的范式。代码可在 \href\href{https://github.com/MqLeet/LED-Merging}{GitHub} 获取。

关键词

引用

@article{arxiv.2502.16770,
  title  = {LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint},
  author = {Qianli Ma and Dongrui Liu and Qian Chen and Linfeng Zhang and Jing Shao},
  journal= {arXiv preprint arXiv:2502.16770},
  year   = {2025}
}

备注

Accepted by ACL2025 main conference