面向百万级依赖建模的长序列模型统一视角
机器学习
2023-02-17 v3 人工智能
摘要
自诞生以来,Transformer凭借其快速训练和卓越性能,在许多任务(如NLP、图像分类和视频/音频处理)中取代了传统序列模型。其诸多优点归功于位置编码和多头注意力。然而,由于随上下文长度在时间和空间上均呈二次方复杂度,Transformer在学习长程依赖方面存在不足。因此,在过去五年中,人们提出了大量方法来提升Transformer的效率。在本工作中,我们首先退一步,从纯数学公式角度研究并比较现有的长序列建模方案。具体而言,鉴于它们在token混合上的共性,我们使用统一模板对其进行了总结。通过基准测试,我们随后证明长上下文长度确实能带来更好的性能(尽管依赖于具体应用),而传统Transformer模型难以利用长程依赖。接下来,受新兴的具有巨大容量的稀疏模型启发,我们提出了一种用于处理百万级依赖的机器学习系统。作为概念验证,我们评估了该系统中一个核心组件即分布式多头注意力的性能。我们表明,与使用四块GeForce RTX 4090 GPU的普通多头注意力机制相比,我们的算法可将注意力计算扩展近 。我们认为本研究是迈向百万级依赖建模的重要一步。
引用
@article{arxiv.2302.06218,
title = {A Unified View of Long-Sequence Models towards Modeling Million-Scale Dependencies},
author = {Hongyu Hè and Marko Kabic},
journal= {arXiv preprint arXiv:2302.06218},
year = {2023}
}
备注
20 pages, 7 figures