MoGU V2:迈向模型可用性与安全性之间更高的 Pareto 前沿
计算与语言
2025-09-09 v1
摘要
随着大型语言模型(LLM)日益渗透到人类生活中,其安全性已成为关键问题,尤其是它们对恶意指令保持无害响应的能力。尽管已有大量方法提升了 LLM 的安全性,但它们往往导致保守的、拒绝导向的响应,从而损害了实际可用性。这提出了一个关键挑战:如何推进 LLM 可用性与安全性之间的 Pareto 前沿,而不是在两者之间进行权衡。为了解决这个问题,我们提出了 MoGU 框架,其中层内路由器通过感知隐藏状态动态分配权重,从而平衡安全优化变体和可用性优化变体的贡献。尽管 MoGU 框架具有初步潜力,但它面临参数冗余和性能瓶颈等局限性。为了克服这些问题,我们进一步提出了改进的 MoGU_v2 框架,该框架在路由器和隐藏状态之间建立了更紧密的耦合。在 MoGU_v2 中,路由器仅嵌入在编码高度可分类安全特征的层中,并且在路由器优化期间激活骨干模块以实现双向适应。MoGU_V2 在各种系列的 LLM 上表现出强大的适应性和稳定的改进,包括在各种应用中作为大脑的主流 LLM、为资源受限场景优化的端侧 LLM,以及为用户可解释性量身定制的推理 LLM。同时,即使面临指令微调带来的风险,MoGU_v2 也能通过简单的数据混合策略轻松恢复安全性,而不影响任务性能的提升。这些全面的改进突显了 MoGU_V2 作为缓解现实应用中安全风险的稳健且通用的解决方案。
引用
@article{arxiv.2509.06807,
title = {MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security},
author = {Yanrui Du and Fenglei Fan and Sendong Zhao and Jiawei Cao and Ting Liu and Bing Qin},
journal= {arXiv preprint arXiv:2509.06807},
year = {2025}
}