理解基础模型中的差异:注意力、状态空间模型和循环神经网络
机器学习
2024-12-10 v3 人工智能
系统与控制
系统与控制
摘要
Softmax注意力是各种人工智能应用中基础模型的主要支柱,但其在序列长度上的二次复杂度可能限制长上下文场景的推理吞吐量。为解决这一挑战,线性注意力、状态空间模型(SSM)和循环神经网络(RNN)等替代架构被认为是更高效的替代方案。尽管这些方法之间存在联系,但此类模型通常孤立开发,缺乏对这些架构共享原理及其细微差异的理论理解,而这些差异极大地影响性能和可扩展性。本文引入动力系统框架(DSF),该框架允许在统一表示中对所有这些架构进行原则性研究。我们的框架促进了严格比较,为每个模型类别的独特特征提供了新见解。例如,我们比较了线性注意力和选择性SSM,详细说明了它们的差异以及两者等价的条件。我们还提供了softmax注意力与其他模型类别之间的原则性比较,讨论了softmax注意力可以被近似的理论条件。此外,我们通过实证验证和数学论证证实了这些新见解。这表明DSF有潜力指导未来更高效和可扩展的基础模型的系统开发。
引用
@article{arxiv.2405.15731,
title = {Understanding the differences in Foundation Models: Attention, State Space Models, and Recurrent Neural Networks},
author = {Jerome Sieber and Carmen Amo Alonso and Alexandre Didier and Melanie N. Zeilinger and Antonio Orvieto},
journal= {arXiv preprint arXiv:2405.15731},
year = {2024}
}
备注
NeurIPS 2024