中文

Taipan:基于选择性注意力的高效且富有表现力的状态空间语言模型

计算与语言 2024-10-25 v1 人工智能 机器学习

摘要

高效长上下文语言建模是自然语言处理(NLP)中的重要挑战。虽然Transformer在语言任务中占主导地位,但在长序列方面因训练时的二次计算复杂度和推理时线性增长的内存开销而不堪一击。最近的状态空间模型(SSM)如Mamba提供了一种选择,具有恒定的内存使用,但在需要广泛 in-context 检索的任务中性能不足。我们引入Taipan,一种 novel 混合架构,将Mamba-2与选择性注意力层(SALs)结合。这些SALs识别需要长程相互作用的标记,删除不太重要的特征,然后通过注意力模块增强其表示。该方法在平衡Mamba的效率与Transformer在内存密集型任务中的性能方面取得了良好平衡。通过限制注意力预算,Taipan将准确预测延伸至最高可达100万标记的上下文长度,同时保持计算效率。我们的实验表明,Taipan在各种规模和任务上均表现出优异性能,为高效长上下文语言建模提供了有前景的解决方案。

关键词

引用

@article{arxiv.2410.18572,
  title  = {Taipan: Efficient and Expressive State Space Language Models with Selective Attention},
  author = {Chien Van Nguyen and Huy Huu Nguyen and Thang M. Pham and Ruiyi Zhang and Hanieh Deilamsalehy and Puneet Mathur and Ryan A. Rossi and Trung Bui and Viet Dac Lai and Franck Dernoncourt and Thien Huu Nguyen},
  journal= {arXiv preprint arXiv:2410.18572},
  year   = {2024}
}