中文

Transformer 前馈层通过在词汇空间中提升概念来构建预测

计算与语言 2022-10-14 v3

摘要

基于 Transformer 的语言模型(LM)是现代 NLP 的核心,但其内部预测构建过程不透明且在很大程度上未被理解。本工作中,我们朝揭示这一底层预测过程迈出实质性一步,通过对 Transformer 模型基本构件之一的前馈网络(FFN)层的操作进行逆向工程。我们将词元表示视为词汇表上变化的分布,并将每个 FFN 层的输出视为对该分布的可加更新。随后,我们在词汇空间中分析 FFN 更新,表明每个更新可分解为对应于单个 FFN 参数向量的子更新,每个子更新提升往往可被人类理解的概念。我们利用这些发现来控制 LM 预测,将 GPT2 的毒性降低近 50%,并通过简单的提前退出规则提高计算效率,平均节省 20% 的计算量。

关键词

引用

@article{arxiv.2203.14680,
  title  = {Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space},
  author = {Mor Geva and Avi Caciularu and Kevin Ro Wang and Yoav Goldberg},
  journal= {arXiv preprint arXiv:2203.14680},
  year   = {2022}
}

备注

EMNLP 2022