PTW:面向预训练图像生成器的关键调优水印方法
机器学习
2023-11-09 v3 密码学与安全
摘要
Deepfake 指使用深度生成器合成的内容,若被滥用可能削弱对数字媒体的信任。合成高质量 deepfake 需要访问大型复杂生成器,而仅有少数实体能够训练并提供此类生成器。威胁在于恶意用户利用对所提供模型的访问权限生成有害 deepfake 且无需承担被检测的风险。水印通过将可识别码嵌入生成器,并随后可从生成图像中提取该码,从而使 deepfake 可被检测。我们提出关键调优水印(Pivotal Tuning Watermarking, PTW),一种用于预训练生成器水印的方法:(i)比从头训练水印快三个数量级;(ii)无需任何训练数据。我们改进了现有水印方法,并将规模扩展到比相关工作大 的生成器。PTW 能嵌入比现有方法更长的码,同时更好地保持生成器的图像质量。我们提出了基于博弈的鲁棒性与不可检测性的严格定义,且我们的研究揭示:当自适应白盒攻击者控制生成器参数时,水印并不鲁棒。我们提出了一种自适应攻击,仅需访问 200 张无水印图像即可成功移除任意水印。我们的工作对当生成器参数可用时水印用于 deepfake 检测的可信度提出挑战。复现我们实验的源代码见 https://github.com/nilslukas/gan-watermark。
引用
@article{arxiv.2304.07361,
title = {PTW: Pivotal Tuning Watermarking for Pre-Trained Image Generators},
author = {Nils Lukas and Florian Kerschbaum},
journal= {arXiv preprint arXiv:2304.07361},
year = {2023}
}
备注
USENIX Security 2023