中文

删除与保留:文档分类的高效遗忘

机器学习 2025-12-17 v1

摘要

机器遗忘旨在在不进行完整重新训练的情况下,高效地移除特定训练数据对模型的影响。尽管LLM的遗忘研究已取得很大进展,但文档分类模型的遗忘研究仍相对不足。在本文中,我们研究文档分类器的类别级遗忘,并提出Hessian Reassignment,一种两步的、模型无关的解决方案。首先,我们执行一次影响风格的更新,通过共轭梯度法求解Hessian-向量系统,从目标类中减去所有训练点的贡献,仅需要梯度和Hessian-向量乘积。其次,与常见的将删除类样本随机重新分类的遗忘基线方法不同,我们通过Top-1分类强制执行决策空间保证。在标准文本基准测试上,Hessian Reassignment在运行速度提升数个数量级的同时,达到了接近完整重新训练(去除该类)的保留类准确率。此外,它持续降低了被移除类的成员推理优势,通过多阴影攻击池化进行衡量。这些结果展示了文档分类中高效类别级遗忘的一条实用且有原则的路径。

关键词

引用

@article{arxiv.2512.13711,
  title  = {Delete and Retain: Efficient Unlearning for Document Classification},
  author = {Aadya Goel and Mayuri Sridhar},
  journal= {arXiv preprint arXiv:2512.13711},
  year   = {2025}
}

备注

18 pages, 5 figures