深度伪造检测的多模态框架
计算机视觉与模式识别
2024-10-21 v1 人工智能
机器学习
计算机科学中的逻辑
摘要
深度伪造技术的快速发展对数字媒体的完整性构成了重大威胁。深度伪造是指利用人工智能创建的合成媒体,可令人信服地改变视频和音频以曲解事实。这会产生误讯、欺诈的风险,并对个人隐私和安全造成严重影响。我们的研究通过一种创新的多模态方法针对深度伪造这一关键问题展开,目标是处理视觉和听觉元素。这种全面的策略认识到,人类感知将多种感官输入(特别是视觉和听觉信息)整合,以对媒体内容形成完整的理解。对于视觉分析,我们开发了一种模型,采用先进的特征提取技术,从而提取九种不同的面部特征,然后应用各种机器学习和深度学习模型。对于听觉分析,我们的模型利用梅尔频谱图分析进行特征提取,然后应用各种机器学习和深度学习模型。为实现综合分析,我们交换原始数据集中的真实音频和深度伪造音频进行测试,并确保样本平衡。使用我们提出的用于视频和音频分类的模型,即人工神经网络和 VGG19,对整个样本进行分类:如果任一组件被识别为深度伪造,则将其整体判定为深度伪造。我们的多模态框架将视觉和听觉分析相结合,实现了 94% 的准确率。
引用
@article{arxiv.2410.03487,
title = {A Multimodal Framework for Deepfake Detection},
author = {Kashish Gandhi and Prutha Kulkarni and Taran Shah and Piyush Chaudhari and Meera Narvekar and Kranti Ghag},
journal= {arXiv preprint arXiv:2410.03487},
year = {2024}
}
备注
22 pages, 14 figures, Accepted in Journal of Electrical Systems