利用特征真实化轻量卷积神经网络检测合成语音攻击
音频与语音处理
2020-09-22 v1
摘要
现代文本到语音(TTS)和语音转换(VC)系统产生自然 sounding 的语音,对自动说话人验证(ASV)的安全性提出质疑。这使得检测此类合成语音对于保护ASV系统免受未授权访问非常重要。大多数现有欺骗对策在训练时已知攻击性质的情况下表现良好。然而,面对未知性质的攻击时其性能下降。与由广泛TTS和VC方法创建的合成语音相比,真实语音具有更一致的分布。我们认为合成语音与真实语音分布之间的差异是两类之间的重要判别特征。在这方面,我们提出一种称为特征真实化的新方法,该方法仅利用真实语音的特征,学习一个带卷积神经网络(CNN)的变换器(transformer)。然后我们将此真实化变换器与轻量CNN分类器结合使用。ASVspoof 2019逻辑访问语料库被用于评估所提方法。研究表明,所提出的基于特征真实化的LCNN系统优于其他最先进的欺骗对策,显示了其在合成语音攻击检测中的有效性。
引用
@article{arxiv.2009.09637,
title = {Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks},
author = {Zhenzong Wu and Rohan Kumar Das and Jichen Yang and Haizhou Li},
journal= {arXiv preprint arXiv:2009.09637},
year = {2020}
}
备注
Accepted for publication in Interspeech 2020