奇偶性、灵敏度与 Transformer
机器学习
2026-05-08 v2 人工智能
摘要
理解神经网络架构能否计算以及不能计算的内容,是人工智能理论中的核心挑战。其中一个核心问题是 PARITY 任务,即判断二进制输入序列中 1 的个数为奇数还是偶数。PARITY 是计算理论中研究的核心任务,但关于 Transformer 在何种条件下能否解决它仍然不清晰。本文表明,计算 PARITY 所需的 Transformer 最小层数为两层。特别是,我们解决了是否存在一层 Transformer 能计算 PARITY 的开放问题。我们通过表明一层 Transformer 的平均灵敏度增长速度慢于 PARITY 的灵敏度来予以否定。此外,我们提出一种新的 Transformer 构造方法,能够计算 PARITY,该构造在去除大量不实用假设后性能更佳。具体而言,现有针对 PARITY 的 Transformer 构造依赖诸如长度相关位置编码、hardmax、无正则化参数的 layernorm,或与因果掩码不兼容等不实用假设。我们表明,这些假设可被去除,但需将层数从两层增加到四层。具体而言,我们表明使用 softmax 注意力、长度无关且多项式有界的位置编码、无 layernorm,以及兼容因果和非因果掩码的 Transformer 可计算 PARITY。
引用
@article{arxiv.2602.05896,
title = {Parity, Sensitivity, and Transformers},
author = {Alexander Kozachinskiy and Tomasz Steifer and Przemysław Wałȩga},
journal= {arXiv preprint arXiv:2602.05896},
year = {2026}
}
备注
15 pages. Version 2 -- lower bound extended from 1-layer 1-head to 1-layer O(1)-head transformers