基于边际信息正则化的LLM遗忘-MarI
人工智能
2026-01-21 v3 计算与语言
密码学与安全
信息论
机器学习
math.IT
摘要
随着AI模型在不断扩大的数据集上进行训练,从训练好的模型中 selectively 移除特定数据影响的能力变得至关重要,这对于隐私保护和监管合规至关重要。遗忘通过在不从头重新训练的情况下选择性地从训练模型中移除参数知识来解决此挑战,这对于资源密集型的大语言模型(LLM)至关重要。现有的遗忘方法常常通过尝试“遗忘”特定数据时删除超过必要信息,从而降低模型性能。我们引入Forgetting-MarI,一种LLM遗忘框架,可在保留数据支持的同时,严格移除数据对训练模型的额外(边际)信息。通过对边际信息进行惩罚,我们的方法可为遗忘数据集的残余影响提供显式的上界,实现可证明的不可检测性。大量实验确认,我们的方法在 diverse benchmarks 上超越当前最先进的遗忘方法,实现可靠的遗忘并更好地保持一般模型性能。这一进步代表了在不损害其有效性方面,使AI系统更具可控性并遵循隐私和版权法规的重要一步。
关键词
引用
@article{arxiv.2511.11914,
title = {Forgetting-MarI: LLM Unlearning via Marginal Information Regularization},
author = {Shizhou Xu and Yuan Ni and Stefan Broecker and Thomas Strohmer},
journal= {arXiv preprint arXiv:2511.11914},
year = {2026}
}