迈向端到端合成语音检测
音频与语音处理
2021-07-13 v1
摘要
常数 Q 变换(CQT)已被证明是最有效的语音信号预变换之一,有助于合成语音检测,其后接手工提取的(子带)常数 Q 倒谱系数(CQCC)特征与后端二分类器,或直接接深度神经网络(DNN)以进一步提取特征并分类。尽管关于此类流程的文献丰富,我们在本文中表明预变换与手工特征可简单地被端到端 DNN 替代。具体地,我们通过实验验证,仅使用标准组件,轻量级神经网络即可在 ASVspoof2019 挑战赛上超越最先进的方法。所提模型称为时域合成语音检测网络(TSSDNet),具有 ResNet- 或 Inception- 风格的结构。我们进一步证明所提模型还具有吸引人的泛化能力。在 ASVspoof2019 上训练后,当在不相交的 ASVspoof2015 上测试时,它们能取得有前景的检测性能,显著优于现有的跨数据集结果。本文揭示了端到端 DNN 用于合成语音检测的巨大潜力,且无需手工特征。
引用
@article{arxiv.2106.06341,
title = {Towards End-to-End Synthetic Speech Detection},
author = {Guang Hua and Andrew Beng Jin Teoh and Haijian Zhang},
journal= {arXiv preprint arXiv:2106.06341},
year = {2021}
}
备注
Accepted in IEEE Signal Processing Letters 2021