将工具内化为分数变换中的态射
机器学习
2025-11-25 v1 范畴论
摘要
我们提出了针对变换器的分数形式内部符号计算。隐藏空间以grading 形式赋予,符号操作实现为类型化块映射(态射),通过可微路由策略选择性激活。一个自监督的"graded utility functional"(定义为候选态射导致的损失减少) govern activation,产生稀疏、可解释的行为。我们发展了代数和几何基础:一个内部模型范畴,其对象为齐次分量,其态射为可接受的grade转换;编码类型化往返的伴随对;以及以KL增益、镜像下降(带Bregman发散)和Fisher自然梯度为信息几何解释的方法。方法论上,我们指定一个utility-感知路由机制和目标,完全保持端到端可微。分析案例和轻量级 sanity check 说明了在混合符号-语言任务上的选择性态射激活。该框架在"graded transformer" formalism \cite{sh-89,sh-95}下统一了符号计算、几何和自监督学习,同时通过函子内化将先前的外部工具范式(如Toolformer \cite{toolformer2023})包含为特殊情况。
引用
@article{arxiv.2511.17840,
title = {Internalizing Tools as Morphisms in Graded Transformers},
author = {Tony Shaska},
journal= {arXiv preprint arXiv:2511.17840},
year = {2025}
}