中文

利用忘卸技术净化大语言模型

机器学习 2025-10-27 v1 计算与语言

摘要

预训练的大型语言模型(LLM)正在变得越来越有用于各种任务的用途。为了提高其在特定任务上的性能,必须对其进行针对特定数据语料库(例如医学报告、商业数据)的微调。这些专业数据语料库可能包含敏感数据(例如个人或机密数据),这些数据将被模型记忆,并可能在后续使用时被“复述”。这种对敏感信息的模型记忆构成了显著的隐私或机密问题。为在不要求对已获批准数据语料库进行高成本额外微调的情况下删除这种记忆并净化模型,我们提出了SANI。SANI是一种用于净化语言模型的忘卸方法。它依赖于擦除和修复两个阶段:1)重置模型最后几层的某些神经元以破坏对精细信息的记忆,然后2)在避免记忆敏感信息的同时对模型进行微调。我们全面评估了SANI以从记忆模型中删除直接和间接标识符来净化以医学数据训练并专业化的模型,以及从模型中删除由特定术语(定义为机密信息)构成的标准预训练模型。结果表明,仅需少量额外的忘卸 epoch,模型即被净化且复述次数大幅减少。该方法对于已经在大型数据集上花费大量资源训练模型并希望在分享前进行净化的医院或其他行业特别有用。

关键词

引用

@article{arxiv.2510.21322,
  title  = {Leverage Unlearning to Sanitize LLMs},
  author = {Antoine Boutet and Lucas Magnana},
  journal= {arXiv preprint arXiv:2510.21322},
  year   = {2025}
}