使用 wav2vec 2.0 与数据增强的自动说话人验证欺骗与深度伪造检测
音频与语音处理
2022-03-01 v2 声音
摘要
欺骗对抗系统的性能从根本上依赖于使用具有充分代表性的训练数据。由于此类数据通常有限,当前的解决方案通常缺乏对真实环境中遇到的攻击的泛化能力。因此,需要策略来提升在不受控、不可预测攻击下的可靠性。我们在本文中报告了以 wav2vec 2.0 前端结合微调形式的自监督学习的应用努力。尽管初始基础表示仅使用真实数据且无任何欺骗数据学习,我们在 ASVspoof 2021 逻辑访问和 Deepfake 数据库上获得了文献中报道的最低等错误率。当与数据增强结合时,这些结果相对于我们的基线系统对应约 90% 的相对提升。
引用
@article{arxiv.2202.12233,
title = {Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation},
author = {Hemlata Tak and Massimiliano Todisco and Xin Wang and Jee-weon Jung and Junichi Yamagishi and Nicholas Evans},
journal= {arXiv preprint arXiv:2202.12233},
year = {2022}
}
备注
Submitted to Speaker Odyssey Workshop 2022