当先验反作:关于预训练模型对不可学习示例脆弱性的研究
机器学习
2026-03-06 v1
摘要
不可学习示例 (Unlearnable Examples, UEs) 作为数据保护策略,生成难以察觉的扰动以误导模型学习虚假关联而非真实语义。在本文中,我们发现当学习从预训练模型开始时,UEs 存在一种根本性脆弱性。关键在于,我们的实证分析表明,即使数据被精心设计的扰动所保护,预训练的先验仍能提供丰富的语义表示,使模型能够规避 UEs 引入的捷径,捕获真实特征,从而使不可学习性被中和。为解决此问题,我们提出了 BAIT (Binding Artificial perturbations to Incorrect Targets),一种新的双层优化 formulation。具体而言,内层目标是将扰动样本与真实标签关联,以模拟标准的数据-标签对齐;而外层则主动扰乱这种对齐,通过强制将样本映射到指定的错误目标,从而实现误标签-扰动绑定。这种机制有效地覆盖了先验的语义指导,迫使模型依赖注入的扰动,从而防止获取真实语义。广泛的在标准基准和多个预训练 backbone 上的实验表明,BAIT 有效缓解了预训练先验的影响,维持了数据不可学习性。
引用
@article{arxiv.2603.04731,
title = {When Priors Backfire: On the Vulnerability of Unlearnable Examples to Pretraining},
author = {Zhihao Li and Gezheng Xu and Jiale Cai and Ruiyi Fang and Di Wu and Qicheng Lao and Charles Ling and Boyu Wang},
journal= {arXiv preprint arXiv:2603.04731},
year = {2026}
}
备注
ICLR 2026 camera-ready