中文

利用专家:MoE-LLM 中的非授权压缩

机器学习 2025-11-26 v1 人工智能

摘要

混合专家架构因其可扩展性和效率正越来越多地被大型语言模型(LLM)采用。然而,其模块化结构引入了一种独特的漏洞:攻击者可以通过剪枝专家并廉价微调剩余部分来尝试压缩或重用模型,从而有效绕过许可和安全约束。在本文中,我们系统地研究了 MoE-LLM 在特定任务使用下的可剪枝性。我们首先开发了一个专家归因框架,用于识别对给定任务负责最多的专家子集,然后评估剪枝和通过主动学习驱动的微调对这些专家进行重新对齐的性能权衡。我们的发现揭示了一个关键的知识损失—恢复权衡:虽然某些专家可以被隔离以保持任务准确性,但缺乏针对性重新对齐会导致显著性能下降。基于此分析,我们提出了旨在使 MoE 模型更难被非授权压缩和微调 defense 策略,包括纠缠专家训练和选择性微调协议,以抵抗非授权适配。通过将专家剪枝同时定位为威胁向量和防御目标,本工作凸显了 MoE 模块化的双重用途性质,并为 MoE-LLM 的安全特化提供了首个系统性评估框架。

关键词

引用

@article{arxiv.2511.19480,
  title  = {Exploiting the Experts: Unauthorized Compression in MoE-LLMs},
  author = {Pinaki Prasad Guha Neogi and Ahmad Mohammadshirazi and Dheeraj Kulshrestha and Rajiv Ramnath},
  journal= {arXiv preprint arXiv:2511.19480},
  year   = {2025}
}