计算奇偶校验函数的一层Transformer的下界
机器学习
2026-05-13 v1
摘要
本文表明,除非注意力头数与后处理函数的乘积随输入长度线性增长,否则经自注意力层后处理的有理函数无法表示奇偶校验函数。将这一下界与ReLU网络的有理逼近相结合,可得用于后处理由ReLU网络构成的自注意力层的边际依赖扩展。
关键词
引用
@article{arxiv.2605.12171,
title = {Lower bounds for one-layer transformers that compute parity},
author = {Daniel Hsu},
journal= {arXiv preprint arXiv:2605.12171},
year = {2026}
}