中文

从测度保持映射的视角审视 Transformer

计算与语言 2025-10-01 v1 机器学习

摘要

Transformer 是一种深度架构,定义“in-context maps”,以预测给定令牌集合(如 NLP 应用中的提示或视觉 Transformer 中的 patch 集合)中新令牌的能力。在先前的工作中,我们研究了这些架构处理任意数量上下文令牌的能力。为数学上、统一地分析其表达性,我们考虑这些映射是基于表示为概率分布的上下文(对于有限令牌数为离散)的条件。将神经网络建模为概率测度上的映射具有多个应用,如研究 Wasserstein 正则性、证明泛化界限以及对均值场极限下,作为相互作用粒子在通过网络时的动力学进行分析。在本文中,我们研究的问题是 Transformer 执行哪些类型的测度映射。我们完全刻画了通过推送前向(push forward)表示为 in-context maps 的测度映射的性质。一方面,这些包括 Transformer;另一方面,Transformer 对任何连续 in-context map 的表示都有通用逼近。这些性质包括保持支持基数以及其费雷赫导数正部在均匀连续。此外,我们展示了 Vlasov 方程的解映射——一种非局部传输类型——对于均值场极限下相互作用粒子系统的 Cauchy 问题满足上述条件,从而可以被 Transformer 逼近;另一方面,我们证明了测度论自注意力具有确保无限深度、均值场测度论 Transformer 可被识别为 Vlasov 流动的性质。

关键词

引用

@article{arxiv.2509.25611,
  title  = {Transformers through the lens of support-preserving maps between measures},
  author = {Takashi Furuya and Maarten V. de Hoop and Matti Lassas},
  journal= {arXiv preprint arXiv:2509.25611},
  year   = {2025}
}