中文

用于语音欺骗 countermeasure 的欺骗训练数据可利用神经声码器高效生成

音频与语音处理 2023-02-23 v4 声音

摘要

良好的语音欺骗 countermeasure 训练集需要多样的 TTS 与 VC 欺骗攻击,但为目标说话人生成 TTS 与 VC 欺骗试料可能在技术上要求很高。本研究不使用完整的 TTS 与 VC 系统,而是利用基于神经网络的声码器对真实话语进行拷贝合成。其输出数据可用作欺骗数据。为更好地利用真实与欺骗数据对,本研究引入了一种可嵌入标准训练准则的对比特征损失。基于 ASVspoof 2019 逻辑访问训练集中的真实试料,本研究使用若干神经非自回归声码器对所提方式生成的若干训练集进行了实证比较。多个测试集上的结果表明了若干良好实践,例如利用来自目标域的真实数据微调神经声码器。结果也证明了对比特征损失的有效性。结合最佳实践,所训练的 CM 取得了总体具竞争力的性能。其在 ASVspoof 2021 隐藏子集上的 EER 也优于挑战赛第一名提交系统。

关键词

引用

@article{arxiv.2210.10570,
  title  = {Spoofed training data for speech spoofing countermeasure can be efficiently created using neural vocoders},
  author = {Xin Wang and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2210.10570},
  year   = {2023}
}

备注

ICASSP 2023 accepted. Code: https://github.com/nii-yamagishilab/project-NN-Pytorch-scripts/tree/master/project/09-asvspoof-vocoded-trn