中文

RULER:机器遗忘的表征级验证

人工智能 2026-05-28 v1

摘要

机器遗忘旨在从已部署模型中去除特定训练记录的影响,而无需从头重新训练。当前协议通过成员推断、保留准确率和遗忘集合准确率在输出层验证,但模型可能在满足这三者的同时仍编码遗忘记录于其中间表征。我们引入 RULER,一组表征级验证指标。Oracle-comparative 指标 M2 测量遗忘集合记录是否占据与重新训练后模型相同位置的表征。Oracle-free 指标 M4 仅检测遗忘模型内部相似结构的残留,无需重新训练。四种近似遗忘方法在输出级评估中均通过,但在线性混合效应模型下 M2 在 12 种条件中检测到显著残留 (p<0.05),且效应规模随遗忘比例增大。第五种方法 Bad Teacher 显示相同残留,尽管其遗忘机制不同。M4 作为遗忘前诊断工具,在表格、图像、临床文本和面部身份识别等设置中发挥作用:它检测到面部识别模型中身份级记忆,其中无经过测试的方法能完全擦除该信号。

关键词

引用

@article{arxiv.2605.27569,
  title  = {RULER: Representation-Level Verification of Machine Unlearning},
  author = {Georgina Cosma and Axel Finke},
  journal= {arXiv preprint arXiv:2605.27569},
  year   = {2026}
}