视觉模型真的能遗忘吗?Mirage:视觉遗忘的表示层认证
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
纵向联邦学习(VFL)中的机器遗忘引起了越来越多的关注,然而现有方法仅使用输出层指标来认证遗忘。我们通过引入Mirage(一个表示层审计框架)来挑战这些说法,该框架包含四种互补的诊断方法:线性探针恢复(LPR)、中心核对齐(CKA)、特征可分性评分和逐层恢复分析。通过遵循近期VFL遗忘协议在七个数据集和七种基线方法上的实验,Mirage揭示了三个关键发现:(i)遗忘差距:通过输出层认证的方法在其表示中仍然保留了大量的类别结构,LPR超过重新训练基线高达15.4个百分点;CKA显示这些模型在结构上更接近原始模型而非重新训练参考模型,而可分性分数表明存在持续的几何区分性。(ii)遗忘三难困境:没有现有方法能同时实现高效用、输出层遗忘和表示层遗忘。(iii)类别-样本不对称性:类别级遗忘留下强烈的表示痕迹(LPR高达97%),而样本级遗忘与随机水平无异(LPR约50%);逐层分析进一步显示残留的类别信息在网络深度中持续存在。这些发现呼吁在联邦遗忘研究中采用表示感知的评估标准。
引用
@article{arxiv.2605.20282,
title = {Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning},
author = {Zhenyu Yu and Yangchen Zeng and Chunlei Meng and Guangzhen Yao and Shuigeng Zhou},
journal= {arXiv preprint arXiv:2605.20282},
year = {2026}
}