警示:人类无法可靠地检测语音深度伪造
人机交互
2023-08-04 v2 声音
音频与语音处理
摘要
语音深度伪造是由机器学习模型生成的人工语音。既往文献强调深度伪造因可能被滥用,是人工智能进展所引发的最大安全威胁之一。然而,考察人类检测能力的研究十分有限。我们向 n = 529 名受试者播放真实与深度伪造音频,并要求他们辨别深度伪造。实验以英语和普通话进行,以了解语言是否影响检测表现与决策依据。我们发现检测能力并不可靠。听者仅能在 73% 的情况下正确识别深度伪造,且两种语言间可检测性无差异。通过提供语音深度伪造样例以提升听者认知,仅轻微改善结果。随着语音合成算法改进并更趋真实,检测任务预计将更困难。语音深度伪造难以检测,印证了其被滥用的可能,并表明亟需针对该威胁的防御手段。
引用
@article{arxiv.2301.07829,
title = {Warning: Humans Cannot Reliably Detect Speech Deepfakes},
author = {Kimberly T. Mai and Sergi D. Bray and Toby Davies and Lewis D. Griffin},
journal= {arXiv preprint arXiv:2301.07829},
year = {2023}
}