基于Res2Net与相位网络的相位感知伪造语音检测
声音
2022-03-22 v1 人工智能
音频与语音处理
摘要
伪造语音检测(SSD)是自动说话人验证系统的重要对策。尽管在频域利用幅度特征的 SSD 已展现出良好效果,相位信息对于捕获某些类型伪造攻击的伪迹同样重要。因此,必须同时考虑幅度与相位特征,以确保对多样化伪造攻击的泛化能力。本文通过熵分析探究了先前工作特征级融合失败的原因,发现幅度与相位特征间随机性差异较大,会干扰后端神经网络的特征级融合;为此,我们提出相位网络以减小该差异。我们的 SSD 系统:配备相位网络的 Res2Net 取得了显著的性能提升,尤其在被认为相位信息重要的伪造攻击中。此外,我们在已知与未知类型的 SSD 场景下均验证了该系统的实际应用能力。
引用
@article{arxiv.2203.10793,
title = {Phase-Aware Spoof Speech Detection Based on Res2Net with Phase Network},
author = {Juntae Kim and Sung Min Ban},
journal= {arXiv preprint arXiv:2203.10793},
year = {2022}
}