基于Res2net架构的重放与合成语音检测
音频与语音处理
2021-02-16 v3 人工智能
摘要
现有的重放与合成语音检测方法仍缺乏对未知欺骗攻击的泛化能力。本工作提出利用一种称为Res2Net的新型模型结构来提升反欺骗对策的泛化能力。Res2Net主要修改ResNet模块以实现多特征尺度。具体而言,其将一个模块内的特征图拆分为多个通道组,并设计跨不同通道组的类残差连接。这种连接增加了可能的感受野,从而产生多特征尺度。该多尺度机制显著提升了对策对未知欺骗攻击的泛化能力,并且相较于基于ResNet的模型减小了模型尺寸。实验结果表明,在ASVspoof 2019语料的物理接入(PA)和逻辑接入(LA)中,Res2Net模型始终大幅优于ResNet34和ResNet50。此外,与squeeze-and-excitation(SE)模块集成可进一步提升性能。在特征工程方面,我们研究了Res2Net结合不同声学特征的泛化能力,并观察到常数Q变换(CQT)在PA和LA两种场景下均取得最有前景的性能。我们最佳的单系统在两个场景下均优于ASVspoof 2019语料中其他最先进的单系统。
引用
@article{arxiv.2010.15006,
title = {Replay and Synthetic Speech Detection with Res2net Architecture},
author = {Xu Li and Na Li and Chao Weng and Xunying Liu and Dan Su and Dong Yu and Helen Meng},
journal= {arXiv preprint arXiv:2010.15006},
year = {2021}
}
备注
Accepted to ICASSP2021