可调专家混合 —— DeepSeek-R1 推理时行为修改方法
人工智能
2025-02-21 v1 计算与语言
摘要
我们提出了可调专家混合(Mixture-of-Tunable-Experts, MoTE),一种扩展大语言模型(LLM)专家混合架构的方法。无需额外训练,MoTE 即可在推理时对 LLM 实现有意义且聚焦的行为变更。通过一种我们自创的‘功能标记共振成像’(functional Token Resonance Imaging, fTRI)技术——灵感来自 fMRI,并使用旨在触发特定行为(如“{time}{place} 发生了什么?”)的提示符,我们经验性地识别出与拒绝响应等行为相关的独特专家。利用 MoTE,我们能够干预并控制此类特定行为。我们关闭了最具拒绝相关性的前 10 个专家(仅占 R1 14,848 个路由专家的 0.07%),在敏感参考提示上实现了 52% 的拒绝率降低,且在 MT-Bench 上未出现性能下降。随机专家去激活导致较小的行为变化并增加噪声,而强制激活专家则显著提高拒绝率。我们的方法在可解释性和可操控性方面与稀疏自编码器(SAEs)类似。不同于 SAEs,MoTE 不需要大规模训练 effort,因为在专家数量庞大的 MoE 架构中,专家的专业化已在预训练期间自然形成。我们的发现表明,混合专家架构中的显著功能机制至少部分可在少数特定专家中定位,而非在模型权重的整个分布中。专家子组可被调谋以触发显著的行为变化,为理解 LLM 内部工作原理提供了洞见。
引用
@article{arxiv.2502.11096,
title = {Mixture of Tunable Experts -- Behavior Modification of DeepSeek-R1 at Inference Time},
author = {Robert Dahlke and Henrik Klagges and Dan Zecha and Benjamin Merkel and Sven Rohr and Fabian Klemm},
journal= {arXiv preprint arXiv:2502.11096},
year = {2025}
}