中文

深度张量网络

机器学习 2025-09-03 v3 人工智能 计算机视觉与模式识别 量子物理

摘要

Transformer 中引入的点积注意力的二次复杂度仍是阻碍基础模型迈向无界上下文长度的根本瓶颈。为应对此挑战,我们引入深度张量网络,一种新架构框架,通过统一张量代数的表达力与神经网络设计从根本上重构注意力。我们的方法超越了传统的点积注意力及后续的线性时间近似,以捕捉高阶统计依赖。我们由此框架导出两个核心算子:\emph{张量注意力},通过数据依赖的多项式核建模复杂 token 混合;以及张量交互,一种用于自适应通道混合的新机制。我们证明这些算子由二阶摘要驱动,完全避开 n×nn \times n 矩阵的形成,从而实现保持因果性的流式实现,具有 O(d2)O(d^2) 每 token 更新与 O(d2)O(d^2) 状态。该效率可与现代状态空间模型媲美,同时保留类注意力的表述。因此,深度张量网络为下一代序列模型提供了一类原则性且强大的新构建模块,弥合了可扩展计算与丰富、具表达力的交互建模之间的鸿沟。

关键词

引用

@article{arxiv.2311.11091,
  title  = {Deep Tensor Network},
  author = {Yifan Zhang},
  journal= {arXiv preprint arXiv:2311.11091},
  year   = {2025}
}