基于 $\mathsf{RoPE}$ 的张量注意力 Transformer 的表达力理论约束
机器学习
2024-12-25 v1 人工智能
计算复杂性
计算与语言
摘要
张量注意力机制扩展了传统注意力机制,通过捕获跨多个模态的高阶关联,解决了经典基于矩阵的注意力的局限性。而旋转位置嵌入 () 在长上下文场景中表现优异,显著增强了 Transformer 模型的表达能力。尽管存在这些经验性成功,但这些技术的理论局限性仍未得到充分探讨。本研究分析了张量注意力与-基于张量注意力的电路复杂度,表明在多项式精度、常数深度层数和线性或亚线性隐藏维度下,它们无法解决固定成员问题或 闭合问题,前提是假设。这些发现揭示了张量注意力与-基于张量注意力 Transformer 之间存在的经验性能与理论约束之间的差距,为指导更具理论依据的 Transformer 模型设计与规模化发展提供了洞见。
关键词
引用
@article{arxiv.2412.18040,
title = {Theoretical Constraints on the Expressive Power of $\mathsf{RoPE}$-based Tensor Attention Transformers},
author = {Xiaoyu Li and Yingyu Liang and Zhenmei Shi and Zhao Song and Mingda Wan},
journal= {arXiv preprint arXiv:2412.18040},
year = {2024}
}