中文

大型语言模型的马赛克记忆

计算与语言 2025-05-16 v2 机器学习

摘要

随着大型语言模型(LLM)被广泛采用,理解它们如何从训练数据中学习并记忆变得至关重要。人们普遍认为LLM中的记忆仅是由于序列在训练数据中重复而发生的。相反,我们表明LLM通过组装来自相似序列的信息来记忆,我们称之为马赛克记忆。我们展示了主要LLM表现出马赛克记忆,模糊重复对记忆的贡献高达精确重复的0.8,甚至经过大量修改的序列也对记忆有显著贡献。尽管模型展示了推理能力,但令人惊讶的是,我们表明记忆主要是句法性的而非语义性的。最后,我们表明模糊重复在现实世界数据中普遍存在,去重技术无法触及。综合来看,我们的结果挑战了广泛持有的信念,并表明记忆是一个更复杂的马赛克过程,对隐私、保密性、模型效用和评估具有现实意义。

关键词

引用

@article{arxiv.2405.15523,
  title  = {The Mosaic Memory of Large Language Models},
  author = {Igor Shilov and Matthieu Meeus and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2405.15523},
  year   = {2025}
}