Transformer中上下文关系表达能力的理论基础
机器学习
2026-05-19 v3 机器学习
摘要
Transformer架构在建模上下文关系方面取得了显著的实证成功,但对其表达能力的清晰理解仍然缺乏。在这项工作中,我们引入了一个测度论框架,其中上下文关系被建模为概率对象,要么是条件分布,要么是联合分布(耦合)。这一视角揭示了标准softmax注意力与熵正则化最优传输之间的自然联系,提供了一个将注意力视为底层亲和函数归一化的统一视角。在该框架内,我们为使用标准softmax注意力和交替Sinkhorn归一化的上下文系统建立了通用逼近定理。这些结果表明Transformer架构可以逼近任意的上下文关系规则,且归一化方式的选择决定了这些关系的表示方式。此外,它们为Transformer为何能有效建模上下文关系提供了原则性的解释。
引用
@article{arxiv.2603.25860,
title = {On the Expressive Power of Contextual Relations in Transformers},
author = {Demián Fraiman},
journal= {arXiv preprint arXiv:2603.25860},
year = {2026}
}