中文

在符号多步推理任务上训练的 Transformer 的机制分析

机器学习 2024-07-02 v3

摘要

Transformer 在各种推理基准测试中表现出令人印象深刻的性能。为了评估这些能力在多大程度上源于实际的推理,现有工作专注于开发用于行为研究的复杂基准测试。然而,这些研究并未提供关于驱动观察到的能力的内部机制的见解。为了提高我们对 Transformer 内部机制的理解,我们对一个在合成推理任务上训练的 Transformer 进行了全面的机制分析。我们识别了模型用于解决任务的一组可解释机制,并使用相关性和因果证据验证了我们的发现。我们的结果表明,它实现了一种深度有界的循环机制,该机制并行运行并将中间结果存储在选定的 token 位置。我们预期在合成环境中识别出的这些基序 (motifs) 可以为理解 Transformer 更广泛的运行原理提供有价值的见解,从而为理解更复杂的模型奠定基础。

关键词

引用

@article{arxiv.2402.11917,
  title  = {A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task},
  author = {Jannik Brinkmann and Abhay Sheshadri and Victor Levoso and Paul Swoboda and Christian Bartelt},
  journal= {arXiv preprint arXiv:2402.11917},
  year   = {2024}
}