中文

Tracr-Injection:将算法蒸馏到预训练语言模型中

计算与语言 2025-06-03 v3

摘要

受大型语言模型浪潮的推动,人们致力于形式化刻画 transformer 架构内在的符号能力。一种称为 RASP 的编程语言被提出,可直接编译为 transformer 权重以实现这些算法。然而,RASP 可实现的任务往往不常见于自然无监督数据中,这表现为 transformer 架构的理论能力与其从无监督数据学习这些能力的实际可学习性之间的差异。我们提出了 tracr-injection 方法,允许将用 RASP 编写的算法直接蒸馏到预训练语言模型中。我们通过将 3 种不同算法注入语言模型来展示我们的方法。我们展示了该方法如何在模型残差流中创建可解释的子空间,可解码为 RASP 算法代码中存在的变量。此外,我们发现该方法可提高对基线的零样本外推表现,表明模型内部确实存在更符号化的机制。我们发布用于运行实验的代码。

关键词

引用

@article{arxiv.2505.10719,
  title  = {Tracr-Injection: Distilling Algorithms into Pre-trained Language Models},
  author = {Tomás Vergara-Browne and Álvaro Soto},
  journal= {arXiv preprint arXiv:2505.10719},
  year   = {2025}
}

备注

ACL Findings 2025