中文

GRIP:基于几何路由器约束的混合专家模型算法无关机器遗忘

机器学习 2026-02-17 v2 人工智能

摘要

大型语言模型的机器遗忘对于人工智能安全变得至关重要,然而现有方法无法推广到混合专家(MoE)架构。我们发现传统的遗忘方法利用了MoE的架构脆弱性:它们操纵路由器将查询重定向到知识丰富的专家之外,而不是擦除知识,导致模型效用损失和表面遗忘。我们提出了几何路由不变性保持(GRIP),一个用于MoE遗忘的算法无关框架。我们的核心贡献是一个几何约束,通过将路由器梯度更新投影到专家特定的零空间来实现。关键在于,这将路由稳定性与参数刚性解耦:虽然对保留知识的离散专家选择保持稳定,但连续的路由器参数在零空间内保持可塑性,允许模型进行必要的内部重配置以满足遗忘目标。这迫使遗忘优化直接从专家参数中擦除知识,而不是利用表面的路由器操作捷径。GRIP作为一个适配器,在不修改底层遗忘算法的情况下约束路由器参数更新。在大规模MoE模型上的大量实验表明,我们的适配器在所有测试的遗忘方法中消除了专家选择偏移(实现了超过95%的路由稳定性),同时保持了它们的效用。通过防止现有算法利用MoE模型的路由器脆弱性,GRIP将现有的遗忘研究从密集架构适配到MoE。

关键词

引用

@article{arxiv.2601.16905,
  title  = {GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints},
  author = {Andy Zhu and Rongzhe Wei and Yupu Gu and Pan Li},
  journal= {arXiv preprint arXiv:2601.16905},
  year   = {2026}
}