中文

跨转录文本、音频与视频的政治演讲深度伪造人类检测

人机交互 2024-01-17 v4 人工智能

摘要

近期超写实视觉与音频效果技术的进展引发了人们对政治演讲深度伪造视频将很快与真实录像无法区分的担忧。传播理论中的传统观点预测,当同一故事以视频而非文本呈现时,人们会更频繁地相信假新闻。我们开展了 5 项预注册随机实验,共有 2215 名参与者,以评估人类在不同错误信息基线率、音频来源、问题框架与媒体模态下区分真实政治演讲与伪造演讲的准确程度。我们发现错误信息基线率对辨别力影响甚微,且由最先进文本转语音算法生成的音频的深度伪造比相同但由配音演员音频生成的深度伪造更难辨别。此外,在所有实验中,我们发现音频与视觉信息比纯文本能实现更准确的辨别:人类的辨别更依赖于事物如何被说(视听线索),而非说了什么(演讲内容)。

关键词

引用

@article{arxiv.2202.12883,
  title  = {Human Detection of Political Speech Deepfakes across Transcripts, Audio, and Video},
  author = {Matthew Groh and Aruna Sankaranarayanan and Nikhil Singh and Dong Young Kim and Andrew Lippman and Rosalind Picard},
  journal= {arXiv preprint arXiv:2202.12883},
  year   = {2024}
}