中文

GPT-2如何计算大于关系?:解释预训练语言模型中的数学能力

计算与语言 2023-11-03 v5 人工智能 机器学习

摘要

预训练语言模型在未经过显式训练的任务上可能出奇地熟练,但这些能力是如何实现的却鲜为人知。在本文中,我们研究了预训练语言模型常获得的基础数学能力。具体而言,我们使用机制可解释性技术来解释GPT-2 small(有限)的数学能力。作为一个案例研究,我们考察其接收诸如“战争从1732年持续到17”这样的句子并预测有效的两位结束年份(年份>32)的能力。我们首先识别出一个电路,即计算该任务输出的GPT-2 small计算图的一个小子集。然后,我们解释每个电路组件的作用,表明GPT-2 small最终的 multilayer perceptron(多层感知机)提升了大于起始年的结束年份的概率。最后,我们找到了激活我们电路的相关任务。我们的结果表明,GPT-2 small使用一种复杂但通用的机制来计算大于关系,该机制在不同语境下均被激活。

关键词

引用

@article{arxiv.2305.00586,
  title  = {How does GPT-2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model},
  author = {Michael Hanna and Ollie Liu and Alexandre Variengien},
  journal= {arXiv preprint arXiv:2305.00586},
  year   = {2023}
}

备注

NeurIPS 2023