MASCing: 通过激活引导掩码实现可配置的专家混合行为
密码学与安全
2026-05-01 v1
摘要
大型语言模型 (LLM) 中的专家混合 (MoE) 架构通过稀疏激活显著降低了推理成本。然而,这种稀疏激活范式也引入了新的安全挑战。由于每个输入只激活一部分专家,模型行为与路由决策耦合,产生了一种难以控制的机制,该机制在不同安全相关场景下可能表现各异。同时,通过全量微调或重新训练来调整模型行为成本高昂,尤其是当开发者需要为不同的安全目标快速配置同一模型时。我们提出了 MASCing (MoE Activation Steering Configuration),这是第一个无需重新训练即可在多种安全场景下灵活重配置 MoE 行为的框架。MASCing 使用一个基于 LSTM 的代理模型来捕获跨层路由依赖关系,并将路由 logits 映射到下游行为。然后,它优化一个引导矩阵以识别与行为相关的专家电路,并在推理时对路由门应用引导掩码以覆盖专家选择。这能在保持通用语言能力的同时,有针对性地增强或抑制特定行为。为了展示其可重配置性,我们将 MASCing 应用于两个不同的安全相关目标,并在七个开源 MoE 模型上观察到了一致的性能提升,且开销可忽略不计。对于多轮越狱防御,它将平均防御成功率从 52.5% 提高到 83.9%,最高提升达 89.2%。对于成人内容生成,MASCing 使模型能够响应原本会拒绝的请求,将平均生成成功率从 52.6% 提高到 82.0%,最高提升达 93.0%。这些结果确立了 MASCing 作为 MoE 模型中一种实用、轻量级且灵活的特定场景安全重配置框架的地位。
引用
@article{arxiv.2604.27818,
title = {MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks},
author = {Jona te Lintelo and Lichao Wu and Marina Krček and Sengim Karayalçin and Stjepan Picek},
journal= {arXiv preprint arXiv:2604.27818},
year = {2026}
}