中文

面向生成式语言模型的迭代忘却框架

机器学习 2025-09-19 v5 人工智能 计算与语言

摘要

近期机器学习进展,特别是在自然语言处理(NLP)领域,已产生强大的模型,这些模型在庞大数据集上进行训练。然而,这些模型风险泄露敏感信息,引发隐私 concerns。作为响应,欧盟《通用数据保护条例》(GDPR)等监管措施推动了对机器忘却技术的日益关注,这些技术使模型能够选择性地忘却特定数据条目。早期的忘却方法主要依赖预处理方法,而更近期的研究则转向训练性解决方案。尽管这些方法有效,但仍存在一个关键局限:大多数方法需要访问原始训练数据,而这在许多情况下是不可用的。此外,直接应用忘却技术会损害模型的表达能力。为解决这些挑战,我们引入了迭代对抗忘却(ICU)框架,该框架包含三个核心组件:知识忘却诱导模块,用于针对特定知识进行删除并使用忘却损失;对抗学习增强模块,用于在纯粹的忘却目标下保留模型的表达能力;以及迭代忘却精炼模块,通过持续评估和更新动态调整忘却过程。实验结果表明,我们的ICU方法在保持模型总体性能的同时,有效地忘却了敏感信息,为隐私导向的机器学习应用提供了有前景的解决方案。

关键词

引用

@article{arxiv.2407.20271,
  title  = {Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models},
  author = {Haoyu Tang and Ye Liu and Xi Zhao and Xukai Liu and Yanghai Zhang and Kai Zhang and Xiaofang Zhou and Enhong Chen},
  journal= {arXiv preprint arXiv:2407.20271},
  year   = {2025}
}