人类对音频深度伪造的感知:语言与说话风格的作用
音频与语音处理
2025-12-11 v1 信号处理
摘要
音频深度伪造已达到极高的逼真度,使得区分人类声音与人工声音变得越来越困难,这带来了身份盗用或传播虚假信息等风险。尽管存在这些担忧,关于人类识别深度伪造能力的研究仍然有限,大多数研究集中于英语,极少有研究探讨听众感知决策背后的原因。本研究通过一项感知实验填补了这一空白,在该实验中,54 名听众(28 名西班牙语母语者和 26 名日语母语者)将声音分类为自然或合成,并说明了其选择的理由。实验包含 80 个刺激(50% 为人工合成),根据三个变量进行组织:语言(西班牙语/日语)、说话风格(有声书/访谈)以及对声音的熟悉度(熟悉/不熟悉)。目标是考察这些变量如何影响检测,并定性分析听众感知决策背后的原因。结果表明,平均准确率为 59.11%,对真实样本的表现更好。对声音自然性的判断依赖于语言和非语言线索的结合。通过比较日本和西班牙听众,我们的定性分析进一步揭示了听众在概念化语音的“人性”方面既存在共同线索,也存在显著的跨语言差异。总体而言,参与者主要依赖超音段和更高层次或语言外特征——如语调、节奏、流畅度、停顿、语速、呼吸和笑声——而非音段特征。这些发现强调了人类在区分自然语音与人工语音时感知策略的复杂性,并在一定程度上与先前强调韵律和自发语音典型现象(如不流利)重要性的研究相一致。
引用
@article{arxiv.2512.09221,
title = {Human perception of audio deepfakes: the role of language and speaking style},
author = {Eugenia San Segundo and Aurora López-Jareño and Xin Wang and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2512.09221},
year = {2025}
}
备注
Submitted to Speech Communication