中文

ROME:从文本、Logits 和表示中获得的记忆洞察

计算与语言 2024-06-18 v3 人工智能

摘要

以往的工作通过将模型输出与训练语料库进行比较来评估记忆,考察数据重复、模型规模和提示长度等因素如何影响记忆。然而,分析这些庞大的训练语料库非常耗时。为了应对这一挑战,本文提出了一种名为 ROME 的创新方法,该方法绕过了对训练数据的直接处理。具体而言,我们选择了分为三种不同类型的数据集——上下文无关型、常规型和事实型——并将记忆重新定义为在这些条件下产生正确答案的能力。随后,我们的分析通过检查生成文本的 logits 和表示,重点关注被记忆样本与未被记忆样本之间的差异。实验结果表明,较长的词不太可能被记忆,较高的置信度与更大的记忆程度相关,且相同概念的表示在不同上下文中更为相似。本文被接受后,我们的代码和数据将公开发布。

关键词

引用

@article{arxiv.2403.00510,
  title  = {ROME: Memorization Insights from Text, Logits and Representation},
  author = {Bo Li and Qinghua Zhao and Lijie Wen},
  journal= {arXiv preprint arXiv:2403.00510},
  year   = {2024}
}

备注

Submitted to EMNLP, 2024