在符号多步推理任务上训练的 Transformer 的机制分析
机器学习
2024-07-02 v3
摘要
Transformer 在各种推理基准测试中表现出令人印象深刻的性能。为了评估这些能力在多大程度上源于实际的推理,现有工作专注于开发用于行为研究的复杂基准测试。然而,这些研究并未提供关于驱动观察到的能力的内部机制的见解。为了提高我们对 Transformer 内部机制的理解,我们对一个在合成推理任务上训练的 Transformer 进行了全面的机制分析。我们识别了模型用于解决任务的一组可解释机制,并使用相关性和因果证据验证了我们的发现。我们的结果表明,它实现了一种深度有界的循环机制,该机制并行运行并将中间结果存储在选定的 token 位置。我们预期在合成环境中识别出的这些基序 (motifs) 可以为理解 Transformer 更广泛的运行原理提供有价值的见解,从而为理解更复杂的模型奠定基础。
引用
@article{arxiv.2402.11917,
title = {A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task},
author = {Jannik Brinkmann and Abhay Sheshadri and Victor Levoso and Paul Swoboda and Christian Bartelt},
journal= {arXiv preprint arXiv:2402.11917},
year = {2024}
}