中文

反向透镜:将语言模型梯度投影至词表空间

计算与语言 2024-02-21 v1 人工智能 机器学习

摘要

理解基于 Transformer 的语言模型如何学习和回忆信息是深度学习社区的一个关键目标。最近的可解释性方法将前向传播获得的权重和隐藏状态投影到模型的词表中,有助于揭示信息在语言模型内部如何流动。在这项工作中,我们将此方法扩展至语言模型的后向传播和梯度。我们首先证明,梯度矩阵可以被表示为其前向和后向传播输入的低秩线性组合。然后,我们开发了将这些梯度投影至词表项的方法,并探索了新信息如何存储在语言模型神经元中的机制。

关键词

引用

@article{arxiv.2402.12865,
  title  = {Backward Lens: Projecting Language Model Gradients into the Vocabulary Space},
  author = {Shahar Katz and Yonatan Belinkov and Mor Geva and Lior Wolf},
  journal= {arXiv preprint arXiv:2402.12865},
  year   = {2024}
}