机械数据归因:可解释LLM单元训练起源的追踪
计算与语言
2026-01-30 v1 人工智能
机器学习
摘要
尽管机械可解释性已识别出LLM中的可解释电路,但其在训练数据中的因果起源仍然尚不清晰。我们引入机械数据归因(MDA),一种可扩展框架,利用影响函数将可解释单元追溯到特定训练样本。通过对Pythia系列进行大量实验,我们 causally 验证了针对性干预——删除或增强少数高影响样本——显著调制可解释头部的出现,而随机干预则无效。我们的分析揭示了重复结构数据(如LaTeX、XML)作为机械催化剂的作用。此外,我们观察到针对归纳头形成的干预会引发模型在上下文学习(ICL)能力的同步变化。这提供了关于归纳头与ICL之间功能关联的直接因果证据。最后,我们提出一种机械数据增强管道,能在不同模型规模下一致加速电路收敛,为引导LLM发展轨迹提供原则方法。
引用
@article{arxiv.2601.21996,
title = {Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units},
author = {Jianhui Chen and Yuzhang Luo and Liangming Pan},
journal= {arXiv preprint arXiv:2601.21996},
year = {2026}
}