中文

大型语言模型中不可取的记忆现象:综述

计算与语言 2026-01-21 v3 人工智能

摘要

尽管近期研究越来越多地展示了大型语言模型(LLM)的惊人能力,但同样重要的是要审视其相关风险。其中,隐私和安全漏洞尤为令人担忧,带来了重大的伦理和法律挑战。在这些漏洞的核心是记忆现象,这一现象指的是模型存储和再现其训练数据中短语的倾向。已证明这一现象是各种针对大型语言模型的隐私和安全攻击的根本来源。本文我们提供了关于大型语言模型记忆文献的分类学,横跨三个维度:粒度、可检索性和取向。接下来,我们讨论用于量化记忆的指标和方法,随后分析导致记忆现象产生的原因和因素。我们然后探讨迄今为止用于缓解该现象不可取方面的策略。我们通过确定未来短期内的潜在研究主题来总结本综述,包括在平衡隐私与性能方面的方法,以及在特定大型语言模型情境中(如对话代理人、检索增强生成和扩散语言模型)对记忆的分析。鉴于该领域的快速研究进展,我们还维护一个专门的参考文献存储库,用于汇总本综述中讨论的文献,将定期更新以反映最新发展。

关键词

引用

@article{arxiv.2410.02650,
  title  = {Undesirable Memorization in Large Language Models: A Survey},
  author = {Ali Satvaty and Suzan Verberne and Fatih Turkmen},
  journal= {arXiv preprint arXiv:2410.02650},
  year   = {2026}
}