中文

微调方法对大语言模型记忆效应的影响

计算与语言 2025-07-02 v1 人工智能

摘要

随着预训练大语言模型(LLM)能力的不断提升,“预训练-微调”范式日益主流,导致各种微调方法的发展。然而,由于微调期间产生的记忆效应所引发的隐私风险,至今得到的关注相对有限。为填补这一空白,我们对流行的微调方法进行分类,并通过成员推断攻击(MIAs)的视角评估其对记忆效应的影响。我们的结果表明,与基于参数的微调相比,基于提示的微调在性能上具有竞争力,同时对MIAs的脆弱性更低。此外,基于提示的方法在模型规模变化的情况下仍能保持低记忆水平。这些发现表明,基于参数的微调更容易泄露私人信息,而基于提示的微调则是一种更具隐私保护性的选项。

关键词

引用

@article{arxiv.2507.00258,
  title  = {Impact of Fine-Tuning Methods on Memorization in Large Language Models},
  author = {Jie Hou and Chuxiong Wu and Lannan Luo and Qiang Zeng},
  journal= {arXiv preprint arXiv:2507.00258},
  year   = {2025}
}