利用倒谱与双谱统计检测 AI 合成语音
机器学习
2021-04-13 v2 多媒体
音频与语音处理
机器学习
摘要
数字技术使难以想象的诸多应用成为现实。拥有少量便于编辑与处理的工具看似令人兴奋,但也引发了令人警觉的忧虑,这些忧虑可能以语音克隆、复制或深度伪造的形式传播。验证语音的真实性是数字音频取证的主要问题之一。我们提出一种利用双谱与倒谱分析来区分人类语音与 AI 合成语音的方法。与合成语音相比,人类语音的高阶统计相关性更低。此外,倒谱分析揭示人类语音中存在持久的幂成分,而合成语音中缺失该成分。我们整合这两种分析并提出一种机器学习模型来检测 AI 合成语音。
引用
@article{arxiv.2009.01934,
title = {Detection of AI-Synthesized Speech Using Cepstral & Bispectral Statistics},
author = {Arun Kumar Singh and Priyanka Singh},
journal= {arXiv preprint arXiv:2009.01934},
year = {2021}
}
备注
6 Pages, 6 Figures, 1 Table