中文

认知范畴变换器:用于语言建模的范畴论归纳偏置

人工智能 2026-05-29 v1 计算与语言

摘要

认知范畴变换器(Cognitive Categorical Transformer, CCT)是一个 3060 万参数的架构,通过源自范畴论和来自认知科学的多个灵感构建的认知性组件来增强预训练的 GPT-2 Small 主干。我们在 WikiText-103 上按照匹配步数协议(21.5 万次优化步骤、匹配数据、匹配优化器和计划),CCT 在验证 perplexity 上达到 21.27,而 identically fine-tuned 的 GPT-2 Small baseline 为 24.19。该架构因此在 GPT-2 Small 仅有的 in-domain 微调之外,再实现了 2.92 的 PPL(12% 相对)降低。一个从头重新训练的消融实验保留 GT-Full 单纯同位素消息传递(bypassed across the entire seven-phase activation schedule)达到 23.72 PPL,将 84% 的架构改进(2.45 的 2.92 PPL)局部化到 GT-Full。我们present了首个在 WikiText-103 上以 3060 万参数规模进行的消融验证证据,表明单纯同位素消息传递在语言模型 perplexity 上有所改善。已发表的 GPT-2 Large 在 WikiText-103 上以 22.05 的零样本 PPL 表现(参数是 GPT-2 Small 的 6.2 倍);本文将该数字作为外部已发表参考值,而非架构基准。对一致性风格的范畴先验(sheaf smoothing、adjunction round-trip、curvature regularization)以及 GT-Full 和 PrecisionWeightedPP 的联合结构先验结果,支持一种称为*结构/一致性区分*的经验模式,即添加新拓扑的范畴先验改善语言建模,而那些强制一致性恒等式的先验则不行。

关键词

引用

@article{arxiv.2605.28864,
  title  = {The Cognitive Categorical Transformer: Category-Theoretic Inductive Biases for Language Modeling},
  author = {Al Kari},
  journal= {arXiv preprint arXiv:2605.28864},
  year   = {2026}
}