在训练 Deepfake 检测器时能否摒弃 Deepfake 数据?
计算机视觉与模式识别
2024-09-02 v1
摘要
Deepfake 检测器的泛化能力对其在真实场景中的应用至关重要。增强该能力的一种有效解决方案是使用人工混合的数据(我们称之为“blendfake”)来训练模型,这促使模型学习诸如混合边界等通用伪造痕迹。有趣的是,当前的 SoTA 方法在训练过程中利用 blendfake 时并未加入任何 deepfake 数据。这可能是因为先前的经验观察表明,结合 deepfake 和 blendfake 数据的普通混合训练(VHT)的性能不如仅使用 blendfake 数据的方法(即所谓的“1+1<2”)。因此,一个关键问题出现了:我们能否摒弃 deepfake,仅依赖 blendfake 数据来训练有效的 deepfake 检测器?直觉上,由于 deepfake 还包含额外的信息性伪造线索(例如,深度生成痕迹),在训练 deepfake 检测器时排除所有 deepfake 数据似乎有悖常理。在本文中,我们重新思考了 blendfake 在检测 deepfake 中的作用,并将“从真实到 blendfake 再到 deepfake”的过程表述为一种渐进过渡。具体而言,blendfake 和 deepfake 可以被显式地描绘为“真实到伪造”过渡之间的有向枢轴锚点。在这一过渡过程中,伪造信息的积累应当是有向且逐步增加的。为此,我们提出了一种有向渐进正则化器(OPR)来建立约束,迫使锚点的分布呈离散排列。此外,我们引入了特征桥接以促进相邻锚点之间的平滑过渡。大量实验证实,我们的设计能够有效且全面地利用来自 blendfake 和 deepfake 的伪造信息。
引用
@article{arxiv.2408.17052,
title = {Can We Leave Deepfake Data Behind in Training Deepfake Detector?},
author = {Jikang Cheng and Zhiyuan Yan and Ying Zhang and Yuhao Luo and Zhongyuan Wang and Chen Li},
journal= {arXiv preprint arXiv:2408.17052},
year = {2024}
}