注意力头混合:逐Token选择注意力头
计算与语言
2022-10-12 v1
摘要
混合专家网络被提出作为一种扩大模型容量并实现条件计算的有效方法。然而,对 MoE 组件的研究主要集中在 Transformer 架构中的前馈层。本文提出了注意力头混合,这是一种将多头注意力与 MoE 机制相结合的新架构。MoA 包含一组注意力头,每个头都有其自己的参数集。给定输入,路由器逐 token 动态选择 个注意力头的子集。这种条件计算模式使得 MoA 能够取得比标准多头注意力层更强的性能。此外,稀疏门控的 MoA 可以在保持计算效率的同时,轻松扩大注意力头数量和参数数量。除了性能提升外,MoA 还会自动区分各注意力头的效用,为探讨模型的可解释性提供了新视角。我们在包括机器翻译和掩码语言建模在内的几个重要任务上进行了实验。实验表明,在多项任务中,相较于包含大型和超深模型的强基线,该方法均展现出了有前景的结果。
引用
@article{arxiv.2210.05144,
title = {Mixture of Attention Heads: Selecting Attention Heads Per Token},
author = {Xiaofeng Zhang and Yikang Shen and Zeyu Huang and Jie Zhou and Wenge Rong and Zhang Xiong},
journal= {arXiv preprint arXiv:2210.05144},
year = {2022}
}
备注
accepted in EMNLP 2022