融合音视频特征的多模态深度伪造检测
计算机视觉与模式识别
2023-10-09 v1
摘要
深度伪造(deepfake)是经过数字修改的图像或视频形式的 AI 生成媒体。深度伪造技术取得的进展已引发隐私与安全问题。大多数深度伪造检测技术依赖于单一模态的检测。现有的音视频检测方法并不总是超越基于单一模态的分析。因此,本文提出一种基于音视频的深度伪造检测方法,将细粒度深度伪造识别与二分类相融合。我们通过结合各单一模态特有的标签将样本分为四类。该方法增强了域内与跨域测试下的检测能力。
引用
@article{arxiv.2310.03827,
title = {Integrating Audio-Visual Features for Multimodal Deepfake Detection},
author = {Sneha Muppalla and Shan Jia and Siwei Lyu},
journal= {arXiv preprint arXiv:2310.03827},
year = {2023}
}