参考特定的不可学习指标会掩盖真相:一次现实检验
机器学习
2025-10-16 v1
摘要
当前用于生成模型的不可学习指标,基于参考响应或分类器输出来评估成功,而非评估核心目标:不可学习模型是否在行为上与从未见过所需数据的模型几乎不可区分。这种基于参考特定的ethods会创建系统性的盲点,使模型看起来成功,却保留了通过替代提示或攻击可访问的所需知识。我们针对这些限制提出了基于功能对齐的分布等价度量(FADE),这是一种新颖的度量,通过比较生成样本上的双向似然分配来衡量不可学习模型与参考模型之间的分布相似性。与依赖预确定参考的现有方法不同,FADE捕捉整个输出分布上的功能对齐,为真正意义上的不可学习提供原则性评估。我们在用于LLM不可学习的TOFU基准和用于文本到图像扩散模型不可学习的UnlearnCanvas基准上进行实验,发现那些在传统指标上几乎达到最优的方法无法实现分布等价,许多方法在不可学习之后反而与黄金标准更远。这些发现揭示了当前评估实践中的根本性差距,表明FADE为开发和评估真正有效的不可学习方法提供了更稳健的基础。
引用
@article{arxiv.2510.12981,
title = {Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check},
author = {Sungjun Cho and Dasol Hwang and Frederic Sala and Sangheum Hwang and Kyunghyun Cho and Sungmin Cha},
journal= {arXiv preprint arXiv:2510.12981},
year = {2025}
}
备注
20 pages, 11 figures