中文

PLDR-LLM 学习到一个可泛化的张量算子以在推理时替代其自身的深度神经网络

计算与语言 2025-02-25 v2 人工智能 机器学习

摘要

我们证明,基于幂律解码器表示的大语言模型(PLDR-LLM)是一种基础模型,其推演输出在仅受微小扰动的情况下是不变张量。PLDR-LLM 为推演输出学习到一个奇点条件,使得一旦推断出的能量曲率张量 GLM\mathbf{G}_{LM} 能够在推理时替代生成该推演输出的幂律图注意力(PLGA)深度神经网络。我们证明,可以以直接的方式实现 GLM\mathbf{G}_{LM} 的缓存(G-cache)与 KV-cache,以改善推理时间。推演输出的不变性与可泛化特性具有极高的保真度,缓存后推演输出在 15 位小数内具有相同的 RMSE 和行列式值,且零样本基准得分保持不变。消融研究表明,学习到的推演输出在损失和准确率特征上,与以迁移、随机初始化或单位张量作为常量张量算子预训练的模型存在显著差异;而采用缩放点积注意力(SDPA)的 LLM 是 PLDR-LLM 的一个特例,其中 GLM\mathbf{G}_{LM} 被预定义为单位张量。观察到的不变性特征在带缓存的训练与推理阶段之间引入了一种新颖的不对称性。我们概述了学习到的奇点条件下推演输出的共同特征。我们提供了一个带有 KV-cache 和 G-cache 的 PLDR-LLM 训练与推理框架的实现。

关键词

引用

@article{arxiv.2502.13502,
  title  = {PLDR-LLMs Learn A Generalizable Tensor Operator That Can Replace Its Own Deep Neural Net At Inference},
  author = {Burc Gokden},
  journal= {arXiv preprint arXiv:2502.13502},
  year   = {2025}
}

备注

15 pages, 1 figure, 12 tables, more ablation data included