中文

基于 Transformer 的精确序列插值

机器学习 2026-05-14 v3 最优化与控制 机器学习

摘要

我们证明 Transformer 能够精确插值 Rd\mathbb{R}^d (d2d\geq 2) 中有限输入序列及其对应等长或更短输出序列的数据集。具体而言,给定 Rd\mathbb{R}^dNN 个任意但有限长度的序列以及长度为 m1,,mNNm^1, \dots, m^N \in \mathbb{N} 的输出序列,我们构造了一个具有 O(j=1Nmj)\mathcal{O}(\sum_{j=1}^N m^j) 个块和 O(dj=1Nmj)\smash{\mathcal{O}(d \sum_{j=1}^N m^j)} 个参数的 Transformer,能够精确插值该数据集。通过交替使用前馈层和自注意力层并利用后者固有的聚类效应,我们的构造提供了与输入序列长度无关的复杂度估计。我们新颖的构造方法还在自注意力机制中使用了低秩参数矩阵,这是实际 Transformer 实现中的常见特征。这些结果首先在 hardmax 自注意力设定下建立,其几何结构允许进行显式且定量的分析,随后扩展至 softmax 设定。最后,我们展示了精确插值构造在学习问题中的适用性,特别是通过在正则化训练策略下提供对全局极小值的收敛保证。我们的分析有助于对 Transformer 模型的理论理解,解释了其在精确序列到序列插值任务中的优异性能。

关键词

引用

@article{arxiv.2502.02270,
  title  = {Exact Sequence Interpolation with Transformers},
  author = {Albert Alcalde and Giovanni Fantuzzi and Enrique Zuazua},
  journal= {arXiv preprint arXiv:2502.02270},
  year   = {2026}
}

备注

36 pages, 9 figures. Funded by the European Union (Horizon Europe MSCA project ModConFlex, grant number 101073558)