中文

基于声学配置自监督预训练的回放欺骗检测

机器学习 2020-08-20 v2 音频与语音处理 机器学习

摘要

构建回放欺骗检测数据集需要播放一段语音并重新录制的物理过程,这为大规模数据集的收集带来挑战。本研究提出一种利用其他任务(如说话人验证)已发布数据集进行声学配置自监督预训练的框架。此处,声学配置指语音录制过程中生成但不属于语音本身的环境因素,包括麦克风类型、场所与环境噪声水平。具体地,我们从语音中选取片段对,训练深度神经网络判断两片段的声学配置是否相同。我们基于ASVspoof 2019物理接入数据集,利用两个表现优异的系统验证了所提方法的有效性。实验结果表明,所提方法比基线方法性能高出30%。

关键词

引用

@article{arxiv.1910.09778,
  title  = {Self-supervised pre-training with acoustic configurations for replay spoofing detection},
  author = {Hye-jin Shim and Hee-Soo Heo and Jee-weon Jung and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:1910.09778},
  year   = {2020}
}