中文

AI合成印地语语音的检测

声音 2022-03-09 v1 机器学习 音频与语音处理

摘要

生成式人工语音模型的最新进展使得高度逼真的语音信号生成成为可能。起初,获取这些人工合成信号(如语音克隆或深度伪造)似乎令人兴奋,但如果不加管控,可能会导致数字反乌托邦。音频取证的主要焦点之一是验证语音的真实性。尽管已针对英语语音提出了一些解决方案,但合成印地语语音的检测尚未受到足够关注。在此,我们提出一种区分AI合成印地语语音与真实人类语音的方法。我们利用双相干相位(Bicoherence Phase)、双相干幅度(Bicoherence Magnitude)、梅尔频率倒谱系数(MFCC)、Delta倒谱(Delta Cepstral)和Delta平方倒谱(Delta Square Cepstral)作为机器学习模型的判别特征。此外,我们将研究扩展至使用深度神经网络进行广泛实验, specifically以VGG16和自制CNN作为架构模型。我们使用VGG16获得了99.83%的准确率,使用自制CNN模型获得了99.99%的准确率。

关键词

引用

@article{arxiv.2203.03706,
  title  = {Detection of AI Synthesized Hindi Speech},
  author = {Karan Bhatia and Ansh Agrawal and Priyanka Singh and Arun Kumar Singh},
  journal= {arXiv preprint arXiv:2203.03706},
  year   = {2022}
}

备注

5 Pages, 6 Figures, 4 Tables