微调大型语言模型中的记忆现象
计算与语言
2025-08-06 v2 人工智能
摘要
本研究探讨了在微调大型语言模型(LLM)时影响记忆机制与因素,特别关注医疗领域 due to its privacy-sensitive nature。我们检验了微调过程的不同方面如何影响模型记忆训练数据的倾向,使用PHEE药物不良事件数据集。我们的研究采用两种主要方法:成员推断攻击以检测记忆数据,以及带提示前缀的生成任务来评估逐字复现。我们分析了调整变换器架构中不同权重矩阵的影响、困惑度与记忆之间的关系,以及增加低秩适应(LoRA)微调中的秩的效果。关键发现包括:(1) Value 和 Output 矩阵对记忆贡献更大,相较于 Query 和 Key 矩阵;(2) 微调后模型的困惑度较低与增加记忆相关;(3) 更高的 LoRA 秩导致记忆增加,但在更高秩上具有边际递减。这些结果提供了在微调大型语言模型时在性能与隐私风险之间取得平衡的见解。我们的发现对开发更有效且负责任的大型语言模型适应策略具有启发意义,同时管理数据隐私 concerns。
引用
@article{arxiv.2507.21009,
title = {Memorization in Fine-Tuned Large Language Models},
author = {Danil Savine},
journal= {arXiv preprint arXiv:2507.21009},
year = {2025}
}