中文

稀疏门控语言模型中的路由响应上下文

计算与语言 2024-09-24 v1

摘要

语言模型 (LMs) 近期引入了混合专家层,由路由器和一组专家组成,以在固定计算预算下扩大其参数量。基于以往表明 token-expert 分配主要受 token 标识和位置影响的研究,我们追踪了带有相似性标注的文本对的路由决策,以评估学习到的 token-expert 分配的上下文敏感性。我们观察到,编码器层中的路由主要依赖于(语义)关联,但上下文线索提供了额外的细化层。相反,解码器层中的路由更具可变性,且对上下文的敏感性明显较低。

关键词

引用

@article{arxiv.2409.14107,
  title  = {Routing in Sparsely-gated Language Models responds to Context},
  author = {Stefan Arnold and Marian Fietta and Dilara Yesilbas},
  journal= {arXiv preprint arXiv:2409.14107},
  year   = {2024}
}