中文

UpSafe°C:通过升级改造实现大型语言模型的可控安全性

人工智能 2025-10-03 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)在广泛的任务中取得了显著进展,但仍面临有害内容生成和越狱攻击等安全风险。现有的安全技术——包括外部护栏、推理时引导和后训练对齐——各自在安全性、实用性和可控性之间存在权衡。在本工作中,我们提出 UpSafe°C,一个通过安全感知升级改造增强 LLM 安全性的统一框架。我们的方法首先识别安全关键层,并将其升级改造为稀疏的混合专家(MoE)结构,其中路由器充当软护栏,选择性地激活原始 MLP 和新增的安全专家。我们进一步引入两阶段 SFT 策略,在保留通用能力的同时加强安全判别力。为实现推理时的灵活控制,我们引入安全温度机制,允许在安全性与实用性之间动态调整。跨多个基准、基础模型和模型规模的实验表明,UpSafe°C 在抵御有害和越狱输入方面实现了鲁棒的安全提升,同时在通用任务上保持了具有竞争力的性能。此外,分析表明安全温度提供了细粒度的推理时控制,能够在实用性与安全性之间达到帕累托最优前沿。我们的结果揭示了 LLM 安全的新方向:从静态对齐转向动态、模块化和推理感知的控制。

关键词

引用

@article{arxiv.2510.02194,
  title  = {UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models},
  author = {Yuhao Sun and Zhuoer Xu and Shiwen Cui and Kun Yang and Lingyun Yu and Yongdong Zhang and Hongtao Xie},
  journal= {arXiv preprint arXiv:2510.02194},
  year   = {2025}
}