中文

CausalGym:用于衡量语言模型因果可解释性方法的基准测试套件

计算与语言 2024-02-21 v1 人工智能

摘要

语言模型(LM)已被证明是心理语言学研究的强大工具,但大多数 prior 工作仅关注纯行为测量(例如 surprisal 比较)。同时,模型可解释性研究开始揭示塑造 LM 行为的抽象因果机制。为帮助将这两股研究趋势 closer together,我们介绍 CausalGym。我们调整并扩充了 SyntaxGym 套件的任务,以基准测试可解释性方法对模型行为产生因果影响的能力。为了说明 CausalGym 的用途,我们研究 pythia 模型(14M--6.9B),并评估了各种可解释性方法的因果有效性,包括线性探测和分布式对齐搜索(DAS)。我们发现 DAS 优于其他方法,因此我们使用它来研究 pythia-1b 中两个困难语言现象的学习轨迹:负极性项目授权和填空-间隙依赖。我们的分析表明,这两种任务的实现机制是在离散阶段中学习的,而非渐进式学习。

关键词

引用

@article{arxiv.2402.12560,
  title  = {CausalGym: Benchmarking causal interpretability methods on linguistic tasks},
  author = {Aryaman Arora and Dan Jurafsky and Christopher Potts},
  journal= {arXiv preprint arXiv:2402.12560},
  year   = {2024}
}

备注

9 pages main text, 26 pages total