中文

深度伪造法医学分析:源数据集归属及合成媒体操纵的法律影响

计算机视觉与模式识别 2025-05-19 v1

摘要

生成对抗网络(GANs)生成的合成媒体在验证真实性和追溯数据集来源方面 presents 严重挑战,涉及版权执法、隐私保护和法律合规的关键问题。本文引入一种新型法医学框架,通过可解释特征分析识别GAN生成图像的训练数据集来源(如CelebA或FFHQ)。通过集成谱坐标变换(傅里叶/DCT)、颜色分布指标和局部特征描述子(SIFT),我们的管道从合成输出中提取判别性统计信噪。监督分类器(随机森林、SVM、XGBoost)在 diverse GAN架构(StyleGAN、AttGAN、GDWCT、StarGAN和StyleGAN2)上实现98-99%的二分类准确率(真实 vs. 合成)和多类数据集归属。实验结果表明,频域特征(DCT/FFT)在捕捉数据集特定性artifact(如升采样模式和谱波动)方面占主导地位,而颜色直方图揭示了GAN训练中隐式正则化策略。我们进一步探讨了法律和伦理影响,表明数据集归属可解决版权侵权、未经授权的个人数据使用以及GDPR和加州AB 602等框架下的合规问题。该框架推动了生成模型中的问责制和治理,具有广泛的应用前景,涵盖数字法医学、内容 moderation和知识产权诉讼。

关键词

引用

@article{arxiv.2505.11110,
  title  = {Deepfake Forensic Analysis: Source Dataset Attribution and Legal Implications of Synthetic Media Manipulation},
  author = {Massimiliano Cassia and Luca Guarnera and Mirko Casu and Ignazio Zangara and Sebastiano Battiato},
  journal= {arXiv preprint arXiv:2505.11110},
  year   = {2025}
}