面向高级文本转语音模型的音频深度伪造检测
声音
2026-01-29 v1 人工智能
音频与语音处理
摘要
近期文本转语音(TTS)系统的进展大幅提升了合成语音的逼真度,为音频深度伪造检测带来新挑战。本文对三种最新TTS模型——Dia2、Maya1和MeloTTS——进行了比较评估,这些模型分别代表了流式、基于LLM和非自回归架构。我们生成了使用 Daily-Dialog 数据集构建的 12,000 份合成音频样本,并将其评估于四种检测框架,包括语义、结构和信号层面的方法。结果显示,检测器在不同生成机制下的性能存在显著差异:对一种TTS架构有效的模型可能在其他架构上失败,尤其是基于LLM的合成。在 contrast, 一种多视图检测方法结合互补分析层次,展示了在所有评估模型上都表现稳健的性能。这些发现凸显了单一范式检测器的局限性,并强调了针对音频深度伪造威胁不断演变的格局,需要集成检测策略的必要性。
引用
@article{arxiv.2601.20510,
title = {Audio Deepfake Detection in the Age of Advanced Text-to-Speech models},
author = {Robin Singh and Aditya Yogesh Nair and Fabio Palumbo and Florian Barbaro and Anna Dyka and Lohith Rachakonda},
journal= {arXiv preprint arXiv:2601.20510},
year = {2026}
}
备注
This work was performed using HPC resources from GENCI-IDRIS (Grant 2025- AD011016076)