随机掩码微调:减少LLM中PII记忆的高效方法
计算与语言
2026-02-19 v3 密码学与安全
机器学习
摘要
关于自然语言模型尤其是大型语言模型(LLM)中记忆化的当前文献提出了严重的安全和隐私风险,因为模型倾向于从训练数据中记忆个人身份信息(PII)。我们提出了随机掩码微调(RMFT),一种新颖的隐私保护微调技术,在减少PII记忆的同时最小化性能影响。利用Enron邮件数据集,我们证明RMFT相比基线微调实现了80.81%的总提取率降低和80.17%的已见提取率降低,优于去重方法,同时仅保持5.73%的困惑度增加。我们提出了MaxTER,一个用于评估隐私-效用权衡的帕累托最优评估框架,并通过响应曲线下面积(AURC)指标展示了RMFT与去重的性能对比。
引用
@article{arxiv.2512.03310,
title = {Randomized Masked Finetuning: An Efficient Way to Mitigate Memorization of PIIs in LLMs},
author = {Kunj Joshi and David A. Smith},
journal= {arXiv preprint arXiv:2512.03310},
year = {2026}
}