中文

LRPD:大型重放并行数据集

音频与语音处理 2023-10-02 v1 声音

摘要

语音反欺骗(VAS)领域的最新研究表明,深度神经网络(DNN)在呈现攻击检测任务中优于GMM等经典方法。然而,DNN需要大量数据才能收敛,且仍缺乏泛化能力。为促进神经网络系统的进展,我们引入了用于重放攻击检测的大型重放并行数据集(LRPD)。LRPD包含由19种录音设备在17种不同环境中收集的超过100万条语音。我们还提供了PyTorch[1]中的示例训练流程和一个基线系统,其在LRPD评估子集上达到0.28%等错误率(EER),在公开可用的ASVspoof 2017[2]评估集上达到11.91% EER。这些结果表明,用LRPD数据集训练的模型在完全未知条件下具有一致的性能。我们的数据集供研究目的免费使用,托管于GDrive。基线代码与预训练模型可在GitHub获取。

关键词

引用

@article{arxiv.2309.17298,
  title  = {LRPD: Large Replay Parallel Dataset},
  author = {Ivan Yakovlev and Mikhail Melnikov and Nikita Bukhal and Rostislav Makarov and Alexander Alenin and Nikita Torgashov and Anton Okhotnikov},
  journal= {arXiv preprint arXiv:2309.17298},
  year   = {2023}
}