中文

面向大型稀疏模型的哈希层

机器学习 2021-07-21 v3 计算与语言

摘要

我们研究了在大型 Transformer 模型中使用基于哈希为不同输入分配不同参数的稀疏层的训练。具体而言,我们修改前馈层,使其根据当前 token(在序列所有 token 上)哈希到不同的权重集合。我们表明,该过程优于或与诸如 Switch Transformers 和 BASE Layers 等学习路由的混合专家方法具有竞争力,同时不需要路由参数或目标函数中的额外项(如负载均衡损失),也不需要复杂的分配算法。我们研究了不同哈希技术、哈希大小和输入特征的性能,并表明与学习聚类或使用更长范围上下文相比,聚焦于最局部特征的均衡随机哈希效果最佳。我们展示了我们的方法在大型语言建模与对话任务以及下游微调任务上均表现良好。

关键词

引用

@article{arxiv.2106.04426,
  title  = {Hash Layers For Large Sparse Models},
  author = {Stephen Roller and Sainbayar Sukhbaatar and Arthur Szlam and Jason Weston},
  journal= {arXiv preprint arXiv:2106.04426},
  year   = {2021}
}