针对扩散模型的靶向数据保护:通过匹配训练轨迹
人工智能
2025-12-12 v1
摘要
近期扩散模型的进展使针对文本到图像模型进行个性化微调日益便捷,但也引发了关于未授权数据使用和隐私侵犯的严重关切。当前的保护方法局限于被动降低图像质量,无法实现稳定的控制。虽然靶向数据保护(TDP)为主动导向用户指定目标概念的重定向提供了有前景的范式,但现有TDP方法因基于快照匹配的做法而难以控制,由于未能考虑完整的学习动力学。我们引入TAFAP(Trajectory Alignment via Fine-tuning with Adversarial Perturbations),这是首个成功实现有效TDP的方法,通过控制整个训练轨迹来实现控制。不同于基于快照的方法,其保护影响随着训练进程的推进而容易被稀释,TAFAP采用受数据蒸馏启发的轨迹匹配方法,以实现训练期间的持久且可验证的变换。我们通过大量实验进行了方法验证,展示了在同时控制身份和视觉模式的前提下,扩散模型中首次成功的靶向转换。TAFAP显著优于现有TDP尝试,实现了对目标概念的稳健重定向,同时保持高图像质量。本工作实现了可验证的安全措施,为控制和追踪扩散模型输出的 alteration 提供了新框架。
引用
@article{arxiv.2512.10433,
title = {Targeted Data Protection for Diffusion Model by Matching Training Trajectory},
author = {Hojun Lee and Mijin Koo and Yeji Song and Nojun Kwak},
journal= {arXiv preprint arXiv:2512.10433},
year = {2025}
}
备注
AAAI 2026