中文

注意力-only 变压器中间接宾主识别的最小电路的出现

计算与语言 2025-10-30 v1 人工智能 机器学习

摘要

机械可解释性旨在将大型语言模型(LLM)逆向工程为人类可理解的计算电路。然而,预训练模型的复杂性往往掩盖了针对特定推理任务所需的最小机制。在本研究中,我们从头训练小型仅注意力变压器模型,针对间接宾主识别(IOI)任务——一种用于研究变压器中核心指涉推理的基准——进行符号化训练。出乎意料的是,仅由两个注意力头构成的单层模型便实现了完美的 IOI 准确率,尽管该模型缺乏 MLP 和归一化层。通过残差流分解、谱分析和嵌入干预,我们发现这两个注意力头专化为加法和对比子电路,联合实现 IOI 解析。进一步我们展示,两层单注意力头模型通过查询-值相互作用在层之间组合信息,实现了类似的性能。这些结果表明,特定任务的训练可诱导高度可解释的最小电路,为探索变压器推理的计算基础提供了受控测试环境。

关键词

引用

@article{arxiv.2510.25013,
  title  = {Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers},
  author = {Rabin Adhikari},
  journal= {arXiv preprint arXiv:2510.25013},
  year   = {2025}
}

备注

9 pages, 10 figures