中文

NeuronTune:用于 LLM 安全性-实用性平衡的细粒度神经元调制框架

机器学习 2025-08-14 v1 人工智能 计算与语言

摘要

在大型语言模型 (LLM) 可靠部署中,确保安全对齐的同时保持实用性至关重要。然而,现有技术在根本上存在诸多局限:对恶意攻击的鲁棒性不足、频繁拒绝良性查询、生成文本质量和通用任务性能下降——前两者反映了鲁棒安全方面的不足,后两者则构成了实用性损失。我们追溯这些局限性到现有方法中基于粗粒度层级干预所致。为此,我们提出了 NeuronTune,一种通过动态调制稀疏神经元实现安全-实用性同步优化的细粒度框架。我们的 метод首先通过归因识别所有层中的安全关键神经元和保持实用性的神经元,然后采用元学习来自适应放大安全神经元的激活并抑制实用神经元的激活。关键的是,NeuronTune 通过神经元数量阈值实现可调的干预范围,支持针对安全关键或实用性优先场景的灵活适应。广泛的实验结果表明,我们的方法在现有 SOTA 技术之上显著优异,实现了卓越的模型安全性,同时保持了优秀的实用性。

关键词

引用

@article{arxiv.2508.09473,
  title  = {NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs},
  author = {Birong Pan and Mayi Xu and Qiankun Pi and Jianhao Chen and Yuanyuan Zhu and Ming Zhong and Tieyun Qian},
  journal= {arXiv preprint arXiv:2508.09473},
  year   = {2025}
}