中文

通过模型归因视角分析大型语言模型中的记忆化

机器学习 2025-01-10 v1 人工智能

摘要

大型语言模型(LLM)在现代应用中普遍存在,但常常记忆训练数据,导致隐私泄露和版权问题。现有研究主要集中于事后分析,例如提取记忆内容或开发记忆化指标,而未探索导致记忆化的底层架构因素。在这项工作中,我们从架构角度研究记忆化,通过分析不同层的注意力模块如何影响其记忆化和泛化性能。利用归因技术,我们系统地干预LLM架构,绕过特定块的注意力模块,同时保持层归一化和MLP变换等其他组件不变。我们从数学角度提供了分析干预机制的定理,界定了有无归因时层输出的差异。我们的理论和实证分析揭示,深层Transformer块中的注意力模块主要负责记忆化,而早期块对模型的泛化和推理能力至关重要。我们通过在多个LLM家族(Pythia和GPTNeo)和五个基准数据集上的全面实验验证了我们的发现。我们的见解提供了一种实用的方法来减轻LLM中的记忆化,同时保持其性能,有助于在实际应用中更安全、更合乎道德地部署。

关键词

引用

@article{arxiv.2501.05078,
  title  = {Analyzing Memorization in Large Language Models through the Lens of Model Attribution},
  author = {Tarun Ram Menta and Susmit Agrawal and Chirag Agarwal},
  journal= {arXiv preprint arXiv:2501.05078},
  year   = {2025}
}