让专家出主意:基于 MoE 专家特征检测知识蒸馏
机器学习
2025-10-21 v1 人工智能
计算与语言
摘要
知识蒸馏 (KD) 加速大型语言模型 (LLM) 的训练,但带来知识产权保护和 LLM 多样性风险。现有基于自我身份或输出相似性的 KD 检测方法可通过提示工程轻易规避。我们提出一种在白盒和黑盒环境中均有效的 KD 检测框架,利用被忽视的信号:MoE "结构习惯"的转移,尤其是内部路由模式。我们的 approach 分析不同专家在各种输入下如何专门化和合作, creating distinctive fingerprints that persist through the distillation process. 为扩展 Beyond 白盒设置和 MoE 架构,我们进一步提出 Shadow-MoE,一种通过辅助蒸馏构建代理 MoE 表示以比较这些模式之间的黑盒方法。我们建立一个全面的、可复现的基准,提供多样化的蒸馏检查点,并提供可扩展框架以促进未来研究。大量实验表明,我们的方法在各种场景下实现 >94% 检测准确率,并对基于提示的规避具有强大的鲁棒性,超越现有基线,同时揭示了 LLM 中结构习惯的转移。
引用
@article{arxiv.2510.16968,
title = {Leave It to the Experts: Detecting Knowledge Distillation via MoE Expert Signatures},
author = {Pingzhi Li and Morris Yu-Chao Huang and Zhen Tan and Qingquan Song and Jie Peng and Kai Zou and Yu Cheng and Kaidi Xu and Tianlong Chen},
journal= {arXiv preprint arXiv:2510.16968},
year = {2025}
}
备注
Code is at https://github.com/unites-lab/shadow-moe