情感不撒谎:一种利用情感线索的音视频深度伪造检测方法
计算机视觉与模式识别
2020-08-04 v3 机器学习
声音
摘要
我们提出一种基于学习的检测真实与伪造深度伪造多媒体内容的方法。为最大化学习信息,我们提取并分析同一视频内音频与视觉两种模态之间的相似性。此外,我们提取并比较视频内两模态对应的感知情感线索,以推断输入视频为“真实”或“伪造”。我们受 Siamese 网络架构与三元组损失启发,提出一个深度学习网络。为验证模型,我们在两个大规模深度伪造检测数据集 DeepFake-TIMIT Dataset 与 DFDC 上报告 AUC 指标。我们将方法与若干 SOTA 深度伪造检测方法比较,并分别在 DFDC 与 DF-TIMIT 数据集上报告每视频 AUC 为 84.4% 与 96.6%。据我们所知,我们的方法是首个同时利用音频与视频模态以及两模态的感知情感进行深度伪造检测的方法。
引用
@article{arxiv.2003.06711,
title = {Emotions Don't Lie: An Audio-Visual Deepfake Detection Method Using Affective Cues},
author = {Trisha Mittal and Uttaran Bhattacharya and Rohan Chandra and Aniket Bera and Dinesh Manocha},
journal= {arXiv preprint arXiv:2003.06711},
year = {2020}
}
备注
Accepted to ACMMM-2020