从小到大:变规模输入下 Transformer 的泛化界
机器学习
2026-01-12 v2 人工智能
摘要
Transformer 展现出显著的规模泛化特性,展示了从较小 token 集合外推至更长 token 序列的能力。这一行为已在点云、图和自然语言等多种应用中得到记录。尽管其实证成功,该能力仍缺乏严格的理论刻画。在本文中,我们发展了一个理论框架来分析几何数据上的这一现象,我们将几何数据表示为来自连续源的离散采样(例如来自流形的点云、来自图核的图)。我们的核心贡献是对 Transformer 在离散采样上的输出与其连续域等价物之间误差的一个界。我们证明,对于具有稳定位置编码的 Transformer,该界由采样密度和数据流形的内蕴维度决定。在不同规模的图和点云上的实验证实了我们理论界的紧致性。
引用
@article{arxiv.2512.12805,
title = {From Small to Large: Generalization Bounds for Transformers on Variable-Size Inputs},
author = {Anastasiia Alokhina and Pan Li},
journal= {arXiv preprint arXiv:2512.12805},
year = {2026}
}