用于深度伪造检测的常识推理
计算机视觉与模式识别
2024-07-19 v2 计算与语言
摘要
最先进的深度伪造检测方法依赖于通过神经网络提取的基于图像的特征。虽然这些以监督方式训练的方法能够提取可能的伪造特征,但它们可能在表示不自然的“非物理”语义面部属性方面存在不足——模糊的发际线、双眉、僵硬的瞳孔或不自然的皮肤色调。然而,这些面部属性很容易被人类感知,并用于基于人类常识来判断图像的真实性。此外,通过显著性图提供视觉解释的基于图像的特征提取方法可能难以被人类理解。为了解决这些挑战,我们将深度伪造检测构建为一个深度伪造检测VQA(DD-VQA)任务,并通过提供描述将图像标记为真实或伪造的常识原因的文本解释来模拟人类直觉。我们引入了一个新的带注释数据集,并提出了一个基于视觉和语言Transformer的DD-VQA任务框架。我们还整合了文本和图像感知的特征对齐公式,以增强多模态表示学习。结果,我们通过整合从DD-VQA任务中推理常识知识的视觉表示,改进了现有的深度伪造检测模型。我们提供了广泛的实证结果,表明我们的方法在深度伪造检测任务中增强了检测性能、泛化能力和基于语言的可解释性。
引用
@article{arxiv.2402.00126,
title = {Common Sense Reasoning for Deepfake Detection},
author = {Yue Zhang and Ben Colman and Xiao Guo and Ali Shahriyari and Gaurav Bharaj},
journal= {arXiv preprint arXiv:2402.00126},
year = {2024}
}