中文

大语言模型中涌现且可预测的记诵现象

计算与语言 2023-06-02 v2

摘要

记诵,即大语言模型(LLMs)逐字输出其训练数据中完整序列的倾向,是安全部署语言模型的一个关键关切。尤其重要的是,需将模型对敏感数据点(如含个人可识别信息(PII)的数据点)的记诵降至最低。此类不良记诵的普遍存在会给模型训练者带来问题,甚至可能需要丢弃一个原本可用的模型。因此,我们通过外推低算力试运行的记诵行为,在大型模型完整训练前预测哪些序列会被记诵。我们度量了 Pythia 模型套件的记诵现象并绘制了用于预测记诵的缩放律,从而能提供等算力建议以最大化此类预测的可靠性(召回率)。我们还进一步新颖地发现了记诵分数在模型与数据间的分布规律。我们在 https://github.com/EleutherAI/pythia 发布了复现本文结果所需的全部代码与数据。

关键词

引用

@article{arxiv.2304.11158,
  title  = {Emergent and Predictable Memorization in Large Language Models},
  author = {Stella Biderman and USVSN Sai Prashanth and Lintang Sutawika and Hailey Schoelkopf and Quentin Anthony and Shivanshu Purohit and Edward Raff},
  journal= {arXiv preprint arXiv:2304.11158},
  year   = {2023}
}