LRPD:大型重放并行数据集
音频与语音处理
2023-10-02 v1 声音
摘要
语音反欺骗(VAS)领域的最新研究表明,深度神经网络(DNN)在呈现攻击检测任务中优于GMM等经典方法。然而,DNN需要大量数据才能收敛,且仍缺乏泛化能力。为促进神经网络系统的进展,我们引入了用于重放攻击检测的大型重放并行数据集(LRPD)。LRPD包含由19种录音设备在17种不同环境中收集的超过100万条语音。我们还提供了PyTorch[1]中的示例训练流程和一个基线系统,其在LRPD评估子集上达到0.28%等错误率(EER),在公开可用的ASVspoof 2017[2]评估集上达到11.91% EER。这些结果表明,用LRPD数据集训练的模型在完全未知条件下具有一致的性能。我们的数据集供研究目的免费使用,托管于GDrive。基线代码与预训练模型可在GitHub获取。
引用
@article{arxiv.2309.17298,
title = {LRPD: Large Replay Parallel Dataset},
author = {Ivan Yakovlev and Mikhail Melnikov and Nikita Bukhal and Rostislav Makarov and Alexander Alenin and Nikita Torgashov and Anton Okhotnikov},
journal= {arXiv preprint arXiv:2309.17298},
year = {2023}
}