中文

大规模声码器伪造数据能否改进带自监督前端的话音欺骗计数器measure?

音频与语音处理 2023-12-29 v2 声音

摘要

用于区分未见伪造数据与真实数据的话音欺骗计数器measure(CM)需要多样化的训练数据。虽然许多数据集使用语音合成系统生成的伪造数据,但最近发现由神经声码器声码化的数据也可作为伪造训练数据。由于许多神经声码器在构建与生成上很快,本研究使用多个神经声码器,并基于 VoxCeleb2 语料库创建了超过 9,000 小时的声码化数据。本研究探究了这一大规模声码化数据如何改进使用数据饥渴的自监督学习(SSL)模型的话音欺骗计数器measure。实验表明,当使用在声码化数据上持续训练的 SSL 模型所提取的特征时,多个测试集上的整体 CM 性能得到提升。当使用从持续训练前后两个 SSL 蒸馏得到的新 SSL 时,观察到进一步的改进。带有该蒸馏 SSL 的 CM 在具有挑战性的未见测试集(包括 ASVspoof 2019 逻辑访问、WaveFake 与 In-the-Wild)上优于先前最佳模型。

关键词

引用

@article{arxiv.2309.06014,
  title  = {Can large-scale vocoded spoofed data improve speech spoofing countermeasure with a self-supervised front end?},
  author = {Xin Wang and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2309.06014},
  year   = {2023}
}

备注

To appear in ICASSP 2024. code on github: https://github.com/nii-yamagishilab/project-NN-Pytorch-scripts/tree/master/project/10-asvspoof-vocoded-trn-ssl