精彩矩阵:面向语言建模任务的更高效更有效的架构
机器学习
2024-11-13 v6 人工智能
摘要
我们证明了在状态空间对偶算法中内积形式位置编码的可用性,并研究了不同位置嵌入在混合二次因果自注意力和状态空间对偶算法中的有效性。我们提出了带动态掩码的内函数注意力机制,可提高注意力算法的表达性,并显著避免序列噪声对注意力得分准确性的影响。我们还设计了跨域专家混合方案,可在保持参数利用和检索效率的同时,提高稀疏激活前馈网络的细粒度。上述方法的组合构成了我们的基础模型架构:精彩矩阵。我们在语言建模任务上进行实验,发现精彩矩阵在处理复杂语言任务方面更高效更有效。
引用
@article{arxiv.2407.16958,
title = {Wonderful Matrices: More Efficient and Effective Architecture for Language Modeling Tasks},
author = {Jingze Shi and Bingheng Wu and Lu He and Luchang Jiang},
journal= {arXiv preprint arXiv:2407.16958},
year = {2024}
}
备注
28 pages, 8 figures, 7 tables