中文

解构大型语言模型中的逐字记忆

计算与语言 2024-07-26 v1 机器学习

摘要

大型语言模型 (LLM) 经常以逐字方式记忆长序列,常常带来严重的法律和隐私问题。大量先前工作已使用观察数据研究此类逐字记忆。为补充此类工作,我们构建了一个框架,通过在 Pythia 检查点上进行预训练并注入序列来受控地研究逐字记忆。我们发现:(1) 必须存在非平凡的重复量才会发生逐字记忆;(2) 后续(且据推断更好)检查点更可能对序列进行逐字记忆,即使对于分布之外的序列亦然;(3) 记忆序列的生成由编码高级特征的分布式模型状态触发,并充分利用通用语言建模能力。基于这些发现,我们开发了压力测试来评估 unlearning 方法,发现它们往往无法移除逐字记忆信息,同时也会降低 LM 的性能。总体而言,这些发现挑战了逐字记忆源于特定模型权重或机制的假设。相反,逐字记忆与 LM 的通用能力交织在一起,因此在不降低模型质量的前提下难以隔离和抑制。

关键词

引用

@article{arxiv.2407.17817,
  title  = {Demystifying Verbatim Memorization in Large Language Models},
  author = {Jing Huang and Diyi Yang and Christopher Potts},
  journal= {arXiv preprint arXiv:2407.17817},
  year   = {2024}
}