中文

将工具内化为分数变换中的态射

机器学习 2025-11-25 v1 范畴论

摘要

我们提出了针对变换器的分数形式内部符号计算。隐藏空间以grading V=gGVgV=\bigoplus_{g\in G}V_g形式赋予,符号操作实现为类型化块映射(态射)ϕhg:VgVh\phi_{h\leftarrow g}:V_g\to V_h,通过可微路由策略选择性激活。一个自监督的"graded utility functional"(定义为候选态射导致的损失减少) govern activation,产生稀疏、可解释的行为。我们发展了代数和几何基础:一个内部模型范畴,其对象为齐次分量,其态射为可接受的grade转换;编码类型化往返的伴随对;以及以KL增益、镜像下降(带Bregman发散)和Fisher自然梯度为信息几何解释的方法。方法论上,我们指定一个utility-感知路由机制和目标,完全保持端到端可微。分析案例和轻量级 sanity check 说明了在混合符号-语言任务上的选择性态射激活。该框架在"graded transformer" formalism \cite{sh-89,sh-95}下统一了符号计算、几何和自监督学习,同时通过函子内化将先前的外部工具范式(如Toolformer \cite{toolformer2023})包含为特殊情况。

关键词

引用

@article{arxiv.2511.17840,
  title  = {Internalizing Tools as Morphisms in Graded Transformers},
  author = {Tony Shaska},
  journal= {arXiv preprint arXiv:2511.17840},
  year   = {2025}
}