Hyena 层级结构:迈向更大的卷积语言模型
机器学习
2023-04-21 v3 计算与语言
摘要
深度学习的近期进展严重依赖于大规模 Transformer 的使用,因其具备规模化学习的能力。然而,Transformer 的核心构建模块——注意力算子——在序列长度上呈现二次方代价,限制了可访问的上下文量。现有的基于低秩与稀疏近似的次二次方法需要与稠密注意力层结合才能匹配 Transformer,表明存在能力差距。在本工作中,我们提出 Hyena,一种次二次的注意力替代模块,通过交错隐式参数化的长卷积与数据控制门控构造而成。在数千至数十万 token 序列的召回与推理任务中,Hyena 相比依赖状态空间及其他隐式与显式方法的算子将准确率提升了超过 50 个百分点,匹配基于注意力的模型。我们在标准数据集(WikiText103 与 The Pile)上为无稠密注意力的架构确立了语言建模的新 SOTA,在序列长度 2K 下以所需训练计算量减少 20% 达到 Transformer 质量。Hyena 算子在序列长度 8K 下比高度优化的注意力快两倍,在序列长度 64K 下快 100 倍。
引用
@article{arxiv.2302.10866,
title = {Hyena Hierarchy: Towards Larger Convolutional Language Models},
author = {Michael Poli and Stefano Massaroli and Eric Nguyen and Daniel Y. Fu and Tri Dao and Stephen Baccus and Yoshua Bengio and Stefano Ermon and Christopher Ré},
journal= {arXiv preprint arXiv:2302.10866},
year = {2023}
}
备注
Additional details