中文

大学生群体对音频深度伪造的感知研究

声音 2021-12-08 v1 人工智能 音频与语音处理

摘要

深度伪造是指利用 AI 方法生成或操纵以冒充真实的内容或材料。深度伪造有四种不同类型:音频、视频、图像和文本。在本研究中,我们关注音频深度伪造以及人们如何感知它。有若干音频深度伪造生成框架,但我们选择了 MelGAN,这是一种非自回归且快速的音频深度伪造生成框架,所需参数更少。本研究试图评估不同专业大学生对音频深度伪造的感知。本研究还回答了他们的背景和专业如何影响其针对 AI 生成的深度伪造的感知这一问题。我们还基于以下不同方面分析了结果:年级水平、音频片段中所用语法的复杂程度、音频片段的长度、是否知晓深度伪造一词以及政治角度。有趣的是,结果表明当音频片段具有政治内涵时,即使内容相当相似,也会影响人们对其真实或伪造的判断。本研究还探讨了背景和专业如何影响对深度伪造的感知这一问题。

关键词

引用

@article{arxiv.2112.03351,
  title  = {Audio Deepfake Perceptions in College Going Populations},
  author = {Gabrielle Watson and Zahra Khanjani and Vandana P. Janeja},
  journal= {arXiv preprint arXiv:2112.03351},
  year   = {2021}
}

备注

Summary of study findings