中文

Monet:面向Transformer的单义专家混合架构

人工智能 2025-06-12 v4

摘要

理解大型语言模型(LLMs)的内部计算对于使其与人类价值观对齐并防止生成有害内容等不良行为至关重要。然而,机制可解释性受到多义性(即单个神经元响应多个不相关概念)的阻碍。虽然稀疏自编码器(SAEs)试图通过稀疏字典学习来解耦这些特征,但由于依赖事后重建损失,它们损害了LLM的性能。为了解决这个问题,我们引入了面向Transformer的单义专家混合(Monet)架构,该架构将稀疏字典学习直接整合到端到端的专家混合预训练中。我们新颖的专家分解方法使得每层的专家数量能够扩展到262,144个,而总参数量与专家数量的平方根成正比。我们的分析证明了知识在专家间的互斥性,并展示了封装在单个专家内的参数化知识。此外,Monet允许在领域、语言和毒性缓解方面进行知识操控,而不会降低通用性能。我们对透明LLM的追求突显了扩展专家数量以增强机制可解释性并直接重塑内部知识以从根本上调整模型行为的潜力。源代码和预训练检查点可在https://github.com/dmis-lab/Monet获取。

关键词

引用

@article{arxiv.2412.04139,
  title  = {Monet: Mixture of Monosemantic Experts for Transformers},
  author = {Jungwoo Park and Young Jin Ahn and Kee-Eung Kim and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2412.04139},
  year   = {2025}
}