中文

视听深度伪造检测:技术、挑战、人为因素与感知洞见

计算机视觉与模式识别 2024-11-13 v1 人工智能 机器学习 多媒体 声音 图像与视频处理

摘要

深度学习已成功应用于多个领域,其对深度伪造检测的影响也不例外。深度伪造是虚假但逼真的合成内容,可被欺骗性地用于政治冒充、网络钓鱼、诽谤或传播虚假信息。尽管单模态深度伪造检测研究已相当广泛,但通过联合分析音频和视频流来识别复杂深度伪造的研究仍相对较少。为填补这一空白,本综述首先概述了视听深度伪造生成技术、应用及其后果,随后全面回顾了结合音频和视觉模态以提高检测准确性的最新方法,总结并批判性地分析了它们的优势与局限。此外,我们讨论了现有的开源数据集以加深理解,这有助于研究社区,并为希望分析基于深度学习的视听视频取证方法的初学者提供必要信息。通过弥合单模态与多模态方法之间的差距,本文旨在提高深度伪造检测策略的有效性,并指导网络安全和媒体完整性领域的未来研究。

关键词

引用

@article{arxiv.2411.07650,
  title  = {Understanding Audiovisual Deepfake Detection: Techniques, Challenges, Human Factors and Perceptual Insights},
  author = {Ammarah Hashmi and Sahibzada Adil Shahzad and Chia-Wen Lin and Yu Tsao and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2411.07650},
  year   = {2024}
}