中文

基于语义锚点的余弦相似度路由用于可解释混合专家语言模型

计算与语言 2026-04-17 v2 人工智能

摘要

混合专家(MoE)模型通过稀疏激活提高效率,但其学习到的门控函数对路由决策提供有限的洞察。本工作引入了语义共振架构(SRA),通过 token 表示与可学习语义锚点之间的余弦相似度将 token 路由到专家,使每个路由决策可直接追溯到锚点-token 相似度分数。我们在 WikiText-103 上评估了 SRA,涵盖 17 种配置。在受控的多种子比较中(3 颗种子 × 4 种配置,256 个专家,Dff=256D_{ff}=256),余弦路由与标准线性路由达到了竞争性的困惑度(K=14K=1 \to 4 时为 12.57±0.0312.57 \pm 0.03 vs 12.45±0.0312.45 \pm 0.03K=24K=2 \to 4 时为 12.52±0.0212.52 \pm 0.02 vs 12.57±0.0212.57 \pm 0.02)。训练方案——而非路由函数——驱动特化质量,而余弦路由提供了固有的可检查性。我们引入了一种带通路由损失——对专家利用率的上下限走廊——将死专家从 30-45% 降至 0-6%,并迁移到两种路由类型。路由空间评估显示,余弦路由在更深层中提供了显著更好的词级子词连贯性(p<0.001p < 0.001),其中 44-54% 的专家特化是句法而非语义的。扩展分析揭示余弦路由保持了更稳定的路由器饱和度和更紧的每专家词汇分布——这些来自有界余弦相似度范围的结构优势。推理时的 kk 扫描显示,k=5k=5 相比 k=4k=4 获得了 0.08-0.16 的免费困惑度提升。跨数据集验证在 OpenWebText 上确认了泛化性:余弦路由达到了可比的困惑度(44.88 vs 45.44),带通损失消除了死专家,且特化模式得以保留。

关键词

引用

@article{arxiv.2509.14255,
  title  = {Cosine-Similarity Routing with Semantic Anchors for Interpretable Mixture-of-Experts Language Models},
  author = {Ivan Ternovtsii and Yurii Bilak},
  journal= {arXiv preprint arXiv:2509.14255},
  year   = {2026}
}

备注

23 pages, 6 figures. Code available at https://github.com/ITernovtsii/semantic-resonance. Preprint