基于原始波形 CLDNN 的端到端欺骗检测
音频与语音处理
2020-07-28 v1 声音
摘要
尽管近期说话人验证方面的进展生成了强大的模型,但通常无法应对以欺骗语音形式出现的恶意攻击。ASVSpoof2015 和 BTAS2016 挑战赛的近期结果表明,防欺骗感知特征是该问题的一种可能解决方案。这两次挑战赛中最成功的方法侧重于防欺骗感知特征,而非侧重于强大的分类器。在本文中,我们提出了一种用于欺骗检测的基于原始波形的新型深度模型,该模型同时充当特征提取器和分类器,从而允许其直接对语音信号进行分类。这种方法可被视为一个端到端分类器,消除了对数据进行任何预处理或后处理的需求,使训练和评估成为一个流线型过程,比其他基于神经网络的方法耗时更少。在 BTAS2016 数据集上的实验表明,所提出的原始波形卷积长短期神经网络(CLDNN)显著提升了系统性能,将先前已发表的最佳半总错误率(HTER)1.26\% 降至目前的 0.82\% HTER。此外,结果表明所提出的系统在未知(RE-PH2-PH3, RE-LPPH2-PH3)条件下也表现良好。
引用
@article{arxiv.2007.13060,
title = {End-to-end spoofing detection with raw waveform CLDNNs},
author = {Heinrich Dinkel and Nanxin Chen and Yanmin Qian and Kai Yu},
journal= {arXiv preprint arXiv:2007.13060},
year = {2020}
}
备注
5 pages