语义导向的多任务学习用于深度伪造检测:一种联合嵌入方法
计算机视觉与模式识别
2025-05-21 v2
摘要
近年来,多媒体司法和安全社区在深度伪造(即人脸伪造)检测方面取得了显著进展。 prevailing 方法将深度伪造检测诠释为一种通过操纵导向的辅助任务增强的二元分类问题。该方案侧重于学习特定于人脸操纵的特征,泛化能力有限。本文深入研究语义导向的多任务学习,用于深度伪造检测,通过联合嵌入捕获人脸语义之间的关系。我们首先提出一种自动化数据扩张技术,将当前的人脸伪造数据集扩展以支持语义导向的深度伪造检测任务,涵盖全局人脸属性和局部人脸区域水平。此外,我们采用人脸图像和标签(由文本描述表示)的联合嵌入进行预测。该方法消除了对手动设置任务无关和任务特定参数的需求,这通常是对从图像直接预测多个标签所必需的。此外,我们采用双层优化来动态平衡各种任务的保真度损失权重,使训练过程完全自动化。在六个深度伪造数据集上的大量实验表明,我们的方法提高了深度伪造检测的泛化性,并通过提供人类可理解的解释实现了一定程度的模型解释。
引用
@article{arxiv.2408.16305,
title = {Semantics-Oriented Multitask Learning for DeepFake Detection: A Joint Embedding Approach},
author = {Mian Zou and Baosheng Yu and Yibing Zhan and Siwei Lyu and Kede Ma},
journal= {arXiv preprint arXiv:2408.16305},
year = {2025}
}