基于多项式的注意力机制的表达能力
机器学习
2023-11-01 v1
摘要
大语言模型(LLM)已显著改善了我们日常生活的诸多方面。这些模型影响了从医疗到教育的众多领域,提升了生产力、决策过程与可及性。因此,它们在某种程度上影响并重塑了人们的生活方式。然而,Transformer 架构中注意力的二次复杂度在将这些模型扩展至处理长文本上下文时构成了挑战。该问题使得在长文本上训练超大模型或推理时高效使用它们变得不切实际。尽管 [KMZ23] 近期的研究引入了一种用多项式函数与多项式草图替换 softmax 以加速注意力机制的技术,但这一新方法的理论理解尚不充分。本文中,我们对多项式注意力的表达能力提供理论分析。我们的研究揭示了高次与低次多项式注意力在能力上的差异。具体而言,我们构造了两个精心设计的数据集,即 D_0 与 D_1,其中 D_1 包含一个相比 D_0 显著更大的特征值。我们证明,在足够高的次数 β 下,单层多项式注意力网络可区分 D_0 与 D_1;而在低次数 β 下,网络无法有效分离这两个数据集。该分析凸显了高次多项式在放大大数值及区分数据集上的更强有效性。我们的分析增进了对多项式注意力表征能力的理解,并为在注意力机制中引入高次多项式以捕捉复杂语言关联提供了依据。
引用
@article{arxiv.2310.20051,
title = {The Expressibility of Polynomial based Attention Scheme},
author = {Zhao Song and Guangyi Xu and Junze Yin},
journal= {arXiv preprint arXiv:2310.20051},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2310.11685