中文

探究用于语音欺骗防伪的自监督前端

音频与语音处理 2022-02-07 v3 声音

摘要

自监督语音模型是一个快速发展的研究课题,许多预训练模型已被发布并用于各种下游任务。对于语音反欺骗而言,大多数防伪措施(CMs)使用信号处理算法提取声学特征进行分类。在本研究中,我们使用预训练的自监督语音模型作为欺骗防伪措施的前端。我们探究了与该自监督前端相结合的不同后端架构、微调前端的有效性,以及使用不同预训练自监督模型时的性能。我们的研究结果表明,当一个良好的预训练前端在 ASVspoof 2019 逻辑访问(LA)训练集上配合基于浅层或深层神经网络的后端进行微调时,所得防伪措施不仅在 2019 LA 测试集上取得了较低的 EER 分数,而且在 ASVspoof 2015、2021 LA 和 2021 deepfake 测试集上显著优于基线。子带分析进一步表明,该防伪措施主要利用特定频带中的信息来跨测试集区分真实与伪造样本。

关键词

引用

@article{arxiv.2111.07725,
  title  = {Investigating self-supervised front ends for speech spoofing countermeasures},
  author = {Xin Wang and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2111.07725},
  year   = {2022}
}

备注

V3: added sub-band analysis, submitted to ISCA Odyssey2022; V2: added min tDCF results on 2019 and 2021 LA. EERs on LA 2021 were slightly updated to fix one glitch in the score file. EERs and min tDCFs on 2021 LA and DF can be computed using the latest official code https://github.com/asvspoof-challenge/2021. Work in progress. Feedback is welcome!