中文

融合声道与声源特征以揭示伪造语音伪影

音频与语音处理 2022-12-06 v1 声音

摘要

随着合成语音生成技术的快速发展,研究界对区分伪造语音与自然语音的兴趣日益浓厚。识别这些合成信号不仅是前沿分类模型的难题,对人类自身而言也同样困难。为防止潜在的不利影响,检测伪造信号变得至关重要。从取证角度看,预测生成它们的算法以识别伪造者也很重要。这需要理解伪造信号的底层属性,其作为合成器的特征签名。本研究利用声道系统(Vocal Tract System, VTS)与声源(Voice Source, VS)特征,着重于对识别语音信号真实性至关重要的片段。在本文中,我们提出一种既能检测伪造信号又能识别相应语音生成算法的系统。我们在算法分类准确率上达到 99.58%。通过实验,我们发现基于 VS 特征的系统更关注音素的过渡,而基于 VTS 特征的系统更关注语音信号的平稳段。我们对基于 VS 和基于 VTS 的系统进行模型融合,以利用互补信息开发鲁棒分类器。分析混淆图后发现,WaveRNN 分类较差,表现出更高的自然度。另一方面,我们发现诸如 Waveform Concatenation 和 Neural Source Filter 等合成器以最高准确率被分类。本工作的实际意义可同时辅助取证领域(利用伪影)与语音领域(消除伪影)的研究人员。

关键词

引用

@article{arxiv.2212.02013,
  title  = {Evince the artifacts of Spoof Speech by blending Vocal Tract and Voice Source Features},
  author = {Tadipatri Uday Kiran Reddy and Sahukari Chaitanya Varun and Kota Pranav Kumar Sankala Sreekanth and Kodukula Sri Rama Murty},
  journal= {arXiv preprint arXiv:2212.02013},
  year   = {2022}
}