Kan 扩展变换器:注意力、扩散与预测-分离自条件化的范畴统一
机器学习
2026-05-27 v1
摘要
我们提出了 Kan 扩展变换器 (KETs),作为 Transformer 实现的统一范畴框架。核心论点是,变换器层可视为加权结构扩展算子:标准注意力为单体邻域情况,几何变换器风格的 incidences 混合为稀疏边受限情况,KET 为更高阶单纯形情况。该视角还澄清了与扩散式完成的桥梁。当扩展算子作用于分离的预测载体而非教师强制隐藏状态时,它就成为有效的自条件化机制,暴露非因果结构而不泄露金融未来标记。我们对 12 种不同变换器实现进行了全面实验验证,这些实现在严格因果和预测-分离情景下分别在 Penn Treebank、WikiText-2 和 WikiText-103 上进行测试。在严格因果情境下,二次 KET 在 WikiText-2 和 WikiText-103 上是比较因果架构中最强的模型。然而,在所有数据集上,最大收益来自预测-分离情境,而非仅仅改变邻域家族。
引用
@article{arxiv.2605.27259,
title = {Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning},
author = {Sridhar Mahadevan},
journal= {arXiv preprint arXiv:2605.27259},
year = {2026}
}
备注
30 pages