中文

位置注意力:算法计算的可表达性与可学习性

机器学习 2025-06-11 v3 人工智能 数据结构与算法

摘要

越来越多的人关注神经网络在执行算法任务(如算术、概括统计和排序)方面的能力。本 work 的目标是更好地理解注意力在 Transformer 中用于算法执行的作用。其在使用平行计算模型进行理论和实证研究中的重要性已得到探讨。值得注意的是,许多平行算法仅使用位置信息进行处理器之间通信。鼓舞人心的是,这一观察促使我们研究 Transformer 如何使用位置注意力执行算法,其中注意力权重仅取决于位置编码。我们证明,具有位置注意力的 Transformer(位置 Transformer)保持与平行计算模型相同的可表达性,相对于输入长度 incurs a logarithmic depth cost。我们分析它们在分布内的可学习性,并探讨位置注意力中参数范数如何影响样本复杂度。我们的結果表明,位置 Transformer 引入一种学习权衡:尽管它们在参数范数方面表现出更好的理论依赖性,但某些任务可能需要更多层,这反过来可能增加样本复杂度。最后,我们实证探讨了位置 Transformer 在分布外性能,发现它们在其底层算法解决方案依赖于位置信息的任务中表现良好。

关键词

引用

@article{arxiv.2410.01686,
  title  = {Positional Attention: Expressivity and Learnability of Algorithmic Computation},
  author = {Artur Back de Luca and George Giapitzakis and Shenghao Yang and Petar Veličković and Kimon Fountoulakis},
  journal= {arXiv preprint arXiv:2410.01686},
  year   = {2025}
}

备注

64 pages, 37 figures, Forty-Second International Conference on Machine Learning (ICML 2025)