RW-Resnet:一种使用原始波形的新型语音反欺骗模型
声音
2021-08-16 v2 机器学习
音频与语音处理
摘要
近年来,由先进文本到语音(TTS)与语音转换(VC)系统生成的合成语音对自动说话人验证(ASV)系统造成了极大危害,迫使我们设计合成语音检测系统以保护 ASV 系统。本文提出一种名为 ResWavegram-Resnet(RW-Resnet)的新型语音反欺骗模型。该模型包含两部分:Conv1D Resblocks 与骨干 Resnet34。Conv1D Resblock 基于带残差连接的 Conv1D 块。第一部分中,我们使用原始波形作为输入,并将其送入堆叠的 Conv1D Resblocks 以得到 ResWavegram。相比传统方法,ResWavegram 保留了音频信号的全部信息,并具有更强的特征提取能力。第二部分中,提取的特征被送入骨干 Resnet34 以作出伪造或真实判定。我们使用 ASVspoof2019 逻辑访问(LA)语料库评估所提 RW-Resnet。实验结果表明,RW-Resnet 优于其他 SOTA 反欺骗模型,说明了其在检测合成语音攻击中的有效性。
引用
@article{arxiv.2108.05684,
title = {RW-Resnet: A Novel Speech Anti-Spoofing Model Using Raw Waveform},
author = {Youxuan Ma and Zongze Ren and Shugong Xu},
journal= {arXiv preprint arXiv:2108.05684},
year = {2021}
}
备注
Accepted for Interspeech2021