中文

T2UE:从文本描述生成不可训练样本

人工智能 2025-08-06 v1 密码学与安全 计算机视觉与模式识别

摘要

大规模预训练框架如 CLIP 已彻底革新了多模态学习,但其依赖网络爬虞数据集(其中常包含用户私人数据)引发严重的滥用担忧。不可训练样本 (UE) 作为一种针对未授权模型训练的有前景对策,采用精心设计的不可训练噪声来干扰从受保护数据中学习有意义的表示。当前方法通常通过联合优化图像及其关联文本描述(或标签)的不可训练噪声来生成 UE。然而,这种优化过程对设备端执行往往 computationally prohibitive,迫使依赖第三方服务。这就产生了根本的隐私悖论:用户必须首先将其数据暴露给这些服务才能实现保护,从而在过程中妥协了隐私。这种矛盾严重阻碍了实用、可扩展数据保护解决方案的开发。为解决此悖论,我们提出了 Text-to-Unlearnable Example (T2UE),一种新型框架,使用户仅能通过文本描述生成 UE。T2UE 通过采用文本到图像 (T2I) 模型将文本描述映射到图像(噪声)空间,结合误差最小化框架生成有效的不可训练噪声。大量实验表明,T2UE 保护的数据在下游任务(如跨模态检索)中对最新模型的性能显著降低。值得注意的是,保护效应可跨越 diverse architectures 甚至针对监督学习环境进行泛化。我们的工作表明了“零接触数据保护”的可行性,即仅凭其文本描述即可保护个人数据,无需直接数据暴露。

关键词

引用

@article{arxiv.2508.03091,
  title  = {T2UE: Generating Unlearnable Examples from Text Descriptions},
  author = {Xingjun Ma and Hanxun Huang and Tianwei Song and Ye Sun and Yifeng Gao and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2508.03091},
  year   = {2025}
}

备注

To appear in ACM MM 2025