中文

大型语言模型记忆现象的多视角分析

计算与语言 2024-06-05 v4 人工智能

摘要

大型语言模型(LLM)在数十亿参数的大型语料库上进行训练,展现出在各领域的非凡性能。尽管 researchers 对其优异性能感到惊讶,但也注意到这些 LLM 具有一些特殊行为,其中一种是记忆现象,即 LLM 能够生成用于训练其自身的相同内容。尽管之前的研究讨论过记忆现象,但 LLM 的记忆现象仍缺乏解释,特别是记忆的原因以及生成这些记忆的动力学。本研究从多个视角全面讨论记忆现象,并将讨论范围扩展到不仅仅是记忆内容,还包括较少或不记忆的内容。通过各种研究,我们发现:(1)通过实验,我们揭示了记忆与模型规模、 continuation 规模和上下文规模之间的关系。进一步,我们展示了未记忆的句子如何转化为记忆的句子。(2)通过嵌入分析,我们展示了在不同记忆分数的句子在嵌入空间中的分布和解码动力学如何随模型规模变化。n-gram 统计分析表明(3)对 n-gram 和熵解码动力学的分析发现,当模型开始生成记忆句子或未记忆句子时,会出现边界效应。(4)我们训练了一个 Transformer 模型来预测不同模型的记忆现象,表明可以通过上下文预测记忆现象。

关键词

引用

@article{arxiv.2405.11577,
  title  = {A Multi-Perspective Analysis of Memorization in Large Language Models},
  author = {Bowen Chen and Namgi Han and Yusuke Miyao},
  journal= {arXiv preprint arXiv:2405.11577},
  year   = {2024}
}