中文

面向循环变压器的数据归因的逐步解析

机器学习 2026-02-11 v1 人工智能

摘要

我们研究单个训练样本如何影响循环变压器内部计算的方式,其中共享的块被应用于 τ\tau 次循环迭代,以实现隐式推理。现有的训练数据影响估计器,如 TracIn,仅给出一个聚合了所有循环迭代的单一标量分数,掩盖了训练样本在循环计算过程中何时发挥作用。我们提出了"逐步分解影响"(Step-Decomposed Influence, SDI),该方法通过展开循环计算图,将 TracIn 分解为长度为 τ\tau 的影响轨迹,从而将影响归因于特定的循环迭代。为使 SDI 在变压器规模下保持实用,我们提出了 TensorSketch 实现方案,从而避免对每个样本的梯度进行存储。在循环 GPT 风格模型和算法推理任务上的实验表明,SDI 扩展性卓越,与完整梯度基线的误差较小,支持广泛的数据归因和可解释性任务,提供关于隐式推理过程的逐步骤洞察。

关键词

引用

@article{arxiv.2602.10097,
  title  = {Step-resolved data attribution for looped transformers},
  author = {Georgios Kaissis and David Mildenberger and Juan Felipe Gomez and Martin J. Menten and Eleni Triantafillou},
  journal= {arXiv preprint arXiv:2602.10097},
  year   = {2026}
}