Transformers 是贝叶斯网络
人工智能
2026-03-19 v1
摘要
Transformer 是人工智能中主导的架构,然而其工作原理仍鲜有了解.本文提供了一个精确的答案:Transformer 是一个贝叶斯网络.我们以五种方式来证明这一点.首先,我们证明任何带有 sigmoid 激活函数的 Transformer (无论权重为何)都实现了其隐式因子图上的加权 loopy 信念传播.一层即为一次 BP 传播.这适用于任何权重--训练得到的、随机的或构造的.形式上验证于标准数学公理.其次,我们给出一种构造性证明,表明 Transformer 可实现任何声明知识库上的精确信念传播.对于无循环依赖的知识库,这在每个节点上产生可证明正确的概率估计.形式上验证于标准数学公理.第三,我们证明了唯一性:任何产生精确后验分布的 sigmoid Transformer 必然具有 BP 权重.通过 sigmoid 架构实现精确后验唯一地映射到 BP 权重.形式上验证于标准数学公理.第四,我们阐明了 Transformer 层的 AND/OR 布尔结构:注意力机制为 AND,前馈网络为 OR,它们的严格交替正是 Pearl 的 gather/update 算法.第五,我们在实验中确认了所有形式结果,在实践中证实了贝叶斯网络表征.我们也确立了尽管当前缺乏理论收敛保证, loopy 信念传播在实际中仍可行.进一步证明,可验证的推理需要有限概念空间.任何有限验证程序最多只能区分有限多个概念.没有概念 grounding,正确性无法定义.幻觉并非一个可以通过扩大规模可修复的 bug.它是没有概念操作的结构性后果.形式上验证于标准数学公理.
引用
@article{arxiv.2603.17063,
title = {Transformers are Bayesian Networks},
author = {Gregory Coppola},
journal= {arXiv preprint arXiv:2603.17063},
year = {2026}
}