中文

Hydra效应:语言模型计算中的涌现式自我修复

机器学习 2023-08-01 v1 人工智能 计算与语言

摘要

我们利用因果分析考察语言模型计算的内部结构,并展示了两种 motif:(1)一种自适应计算形式,其中对语言模型某一注意力层的消融导致另一层进行补偿(我们称之为Hydra效应),以及(2)后期MLP层的制衡功能,其作用是下调最大似然词元。我们的消融研究表明,语言模型各层通常耦合较为松散(对一层的消融仅影响少量下游层)。令人惊讶的是,即便在未经任何形式dropout训练的语言模型中,这些效应依然存在。我们在事实回忆的背景下分析这些效应,并思考其对语言模型电路级归因的启示。

关键词

引用

@article{arxiv.2307.15771,
  title  = {The Hydra Effect: Emergent Self-repair in Language Model Computations},
  author = {Thomas McGrath and Matthew Rahtz and Janos Kramar and Vladimir Mikulik and Shane Legg},
  journal= {arXiv preprint arXiv:2307.15771},
  year   = {2023}
}