因果路径上的因果干预:映射 GPT-2 从语法到语义的推理过程
计算与语言
2024-10-30 v1 人工智能
摘要
尽管可解释性研究已揭示了基于 Transformer 的大语言模型(LLMs)所使用的一些内部算法,但自然语言推理因其深刻的语境性和模糊性,难以简单归类。因此,为依赖因果干预所需的明确域内和域外示例的电路分析制定清晰且具有启发性的问题颇具挑战。尽管已有大量工作研究了特定任务(如间接宾语识别(IOI))的电路,但由于其固有的复杂性,通过电路解读自然语言推理仍然困难。在这项工作中,我们通过分析诸如“我打开伞是因为开始下雨了”这样清晰的因果句子,迈出了表征 LLM 中因果推理的初步步骤,其中因果干预可能通过使用 GPT-2 small 精心设计的场景来实现。我们的发现表明,因果语法集中在前 2-3 层,而后面几层中的某些注意力头对因果句子的无意义变体表现出高度敏感性。这表明模型可能通过以下方式推断推理:(1)检测句法线索,以及(2)在最后几层中分离出专注于语义关系的不同头。
引用
@article{arxiv.2410.21353,
title = {Causal Interventions on Causal Paths: Mapping GPT-2's Reasoning From Syntax to Semantics},
author = {Isabelle Lee and Joshua Lum and Ziyi Liu and Dani Yogatama},
journal= {arXiv preprint arXiv:2410.21353},
year = {2024}
}
备注
12 pages