伪造内容有多深?聚焦音频深度伪造:一篇综述
声音
2021-11-30 v1 人工智能
音频与语音处理
摘要
Deepfake(深度伪造)是利用人工智能(AI)方法合成或操纵的内容或材料,被冒充为真实内容,可包括音频、视频、图像和文本合成。与大多仅关注视频和图像深度伪造的现有综述论文不同,本综述采用了不同视角。本综述不仅评估不同深度伪造类别中的生成与检测方法,而且主要关注在大多数现有综述中被忽视的音频深度伪造。本文批判性地分析并提供了独特的音频深度伪造研究来源,主要涵盖 2016 至 2020 年。据我们所知,这是首篇聚焦音频深度伪造的英文综述。本综述为读者总结:1)不同深度伪造类别;2)它们如何被创建与检测;3)该领域最新趋势及检测方法的不足;4)音频深度伪造,其如何被创建与检测的细节,此为本文主要焦点。我们发现生成对抗网络(GAN)、卷积神经网络(CNN)和深度神经网络(DNN)是创建与检测深度伪造的常用方式。在我们对超过 140 种方法的评估中发现,多数焦点在视频深度伪造,尤其是视频深度伪造的生成。我们发现文本深度伪造有更多生成方法,但检测鲁棒方法极少,包括假新闻检测,因可能与人类生成虚假内容高度重叠而成为争议研究领域。本文为完整综述的缩略版,揭示了研究音频深度伪造特别是其检测的明确需求。
引用
@article{arxiv.2111.14203,
title = {How Deep Are the Fakes? Focusing on Audio Deepfake: A Survey},
author = {Zahra Khanjani and Gabrielle Watson and Vandana P. Janeja},
journal= {arXiv preprint arXiv:2111.14203},
year = {2021}
}
备注
Abbreviated version of a longer survey under review