中文

追踪与操纵神经数学问题求解器中的中间值

机器学习 2023-01-18 v1 人工智能 计算与语言

摘要

语言模型如何处理需要多步推理的复杂输入尚不清楚。先前的研究表明,可以从模型的激活中提取有关这些输入中间值的信息,但目前尚不清楚该信息编码在何处,以及在推理过程中是否确实被使用。我们引入了一种方法,通过聚焦于简单算术问题及其中间值,来分析 Transformer 模型如何处理这些输入。为了追踪中间值信息编码在何处,我们使用主成分分析(PCA)测量中间值与模型激活之间的相关性。然后,我们通过操纵模型权重进行因果干预。该干预表明,通过追踪识别出的权重不仅与中间值相关,而且与模型预测存在因果关系。我们的发现表明,模型对某些中间值具有局部性,这对于增强模型的可解释性是有用的。

关键词

引用

@article{arxiv.2301.06758,
  title  = {Tracing and Manipulating Intermediate Values in Neural Math Problem Solvers},
  author = {Yuta Matsumoto and Benjamin Heinzerling and Masashi Yoshikawa and Kentaro Inui},
  journal= {arXiv preprint arXiv:2301.06758},
  year   = {2023}
}

备注

5 pages, 4 figures, MathNLP