中文

变换器可证明学习稀疏 XOR,参数为多对数级

机器学习 2026-05-12 v2

摘要

学习稀疏奇偶校验函数已成为研究神经网络特征学习的理论基石。然而,现有分析主要聚焦于前馈神经网络(FFNN)。尽管变换器在该领域取得了实证成功并在长序列上发现稀疏支持方面具有结构优势,但其在此方面的理论理解仍有限。为填补这一空白,我们分析了单层双头变换器如何学习稀疏 XOR 问题。考虑样本 (x,y){±1}d×{±1}(\mathbf{x}, y) \in \lbrace\pm 1\rbrace^d \times \lbrace\pm 1\rbrace,其中标签由 y=xixjy = -x_{i^*} x_{j^*} 对于未知的 i,j[d]i^*, j^* \in [d] 定义。我们证明,仅需 O(polylog(d))O(\mathrm{polylog}(d)) 可训练参数,变换器即可成功发现相关特征并在一个梯度步骤内将每个输入的损失驱动到接近 0。该结果表明变换器突破了 FFNN 在此问题上固有的 Ω(d)\Omega(d) 参数瓶颈。此外,我们实证表明,这种快速特征发现唯一地由精确 softmax 注意力驱动,优于线性或分量注意力等常见替代方案。最后,我们提供了从有限数据学习的理论样本复杂度界,展示了变换器在该任务中的泛化能力。

关键词

引用

@article{arxiv.2502.07553,
  title  = {Transformers Provably Learn Sparse XOR with Polylogarithmic Parameters},
  author = {Yaomengxi Han and Debarghya Ghoshdastidar},
  journal= {arXiv preprint arXiv:2502.07553},
  year   = {2026}
}