中文

通道级语义扰动:多样化训练范式下的不可学习示例

机器学习 2026-05-08 v1 人工智能 密码学与安全

摘要

个人数据在模型训练中的未授权使用已成为日益增长的隐私威胁。不可学习示例 (Unlearnable Examples, UEs) 通过在良性示例中嵌入不可感知的扰动来阻止特征学习。然而,现有研究主要在从零训练设置下评估 UEs,留下了在广泛采用的预训练-微调 (Pretraining-Finetuning, PF) 范式下其行为的探索。本文提供了对不可学习示例在多样化训练范式下进行系统性调查的首次工作。我们的分析揭示,加载和冻结预训练权重显著削弱了现有 UEs 方法的有效性。我们通过语义过滤机制进一步解释了这些发现:虽然 UEs 倾向于诱导模型对非语义噪声过拟合,从而削弱其语义提取能力,但在 PF 范式下,冻结的浅层网络保留了数据语义,有效过滤了像不可学习噪声这样的干扰信息。基于这些洞见,我们提出了一种分层欺骗策略——浅层语义伪装 (Shallow Semantic Camouflage, SSC),旨在将生成过程限制在语义有效子空间内,以绕过预训练权重引入的语义抑制。大量实验表明,我们的方法在各种挑战性训练范式(如浅层冻结和语义聚焦预训练 (Semantic-Focused Pretraining, SF-Pretrain))下,始终保持数据不可学习性,弥合了预训练基础不可学习学习中的关键差距。

关键词

引用

@article{arxiv.2605.05224,
  title  = {Channel-Level Semantic Perturbations: Unlearnable Examples for Diverse Training Paradigms},
  author = {Bo Wang and Jia Ni and Mengnan Zhao and Zhan Qin and Kui Ren},
  journal= {arXiv preprint arXiv:2605.05224},
  year   = {2026}
}