分段Transformer
机器学习
2025-09-03 v2 信息论
math.IT
机器学习
摘要
我们介绍了分段Transformer框架,这是一类新的序列模型,通过对向量空间上的分段变换嵌入代数归纳偏置。扩展分段神经网络(GNNs),我们提出两种体系结构:线性分段Transformer(LGT)和指数分段Transformer(EGT)。这些模型应用参数化缩放算子,由固定或可学习的分段元组控制,特别是EGT中包含指数因子,用于编码注意力和表示层中的层次结构,并提高结构数据的效率。我们建立了严格的保证,包括针对连续函数和Sobolev函数的普遍逼近定理、通过有效VC维界限实现的样本复杂度降低、分段操作的Lipschitz连续性以及对扰动的鲁棒性。分段损失确保梯度稳定性并与领域先验相一致。在将分段视为可微参数的情况下,该框架实现了自适应特征优先级,克服了早期模型中固定分段的局限性。分段Transformer提供了一种在层次学习和神经符号推理中所需的严谨数学方法。应用领域包括代数几何(模空间和zeta函数)、物理(多尺度系统)、自然语言处理(句法解析)、生物序列分析(变异预测)、机器人和自主系统(安全关键优先级)、汽车行业(ADAS的可证明AI)以及区块链和金融密码学(安全编码和结构预测)。
引用
@article{arxiv.2507.20108,
title = {Graded Transformers},
author = {Tony Shaska},
journal= {arXiv preprint arXiv:2507.20108},
year = {2025}
}