中文

PhonemeDF:用于音频深度伪造检测和自然度评估的合成语音数据集

宇宙学与河外天体物理 2026-03-17 v1 广义相对论与量子宇宙学 高能物理 - 理论

摘要

人工智能生成语音的日益成熟正在为音频深度伪造检测带来新挑战。文本语音 (TTS) 和语音转换 (VC) 技术可以创建具有自然度和可理解性的高度逼真的合成语音。这构成了对声纳安全性和旨在减少口语虚假信息传播的系统的严重威胁,其中合成语音可能用于传播虚假或恶意内容。尽管对 AI 生成语音的兴趣增加,但用于在音素水平评估自然度的资源仍有限。本文通过提出 Phoneme-Level DeepFake 数据集 (PhonemeDF) 来弥补这一差距,该数据集包含在音素水平上分割的平行真实与合成语音。真实语音样本来源于 LibriSpeech 的子集,而合成样本则使用四个 TTS 和三个 VC 系统生成。对于每个系统,都使用蒙特拉强制对齐器 (MFA) 获取音素对齐的 TextGrid 文件。我们计算了真实与合成音素分布之间的 Kullback-Leibner 发散 (KLD),以量化保真度并建立基于与自然语音相似性的排序。我们的发现表明,真实与合成音素分布 KLD 与用于区分它们的分类器性能之间存在明确的相关性,这表明 KLD 可作为最具判别性音素的指示器。

关键词

引用

@article{arxiv.2603.15036,
  title  = {Inflation without an Inflaton III: non-Gaussian signatures},
  author = {Mariam Abdelaziz and Marisol Traforetti and Daniele Bertacca and Raul Jimenez and Sabino Matarrese and Angelo Ricciardone},
  journal= {arXiv preprint arXiv:2603.15036},
  year   = {2026}
}