基于原型损失元学习的合成语音检测
音频与语音处理
2022-01-25 v1 密码学与安全
声音
摘要
近期关于语音欺骗对抗措施的研究仍缺乏对未知欺骗攻击的泛化能力。这是 ASVspoof 挑战的关键问题之一,尤其在多样且高质量欺骗算法快速发展的背景下。在本工作中,我们通过提出元学习范式下的原型损失来模拟训练期间的未知测试场景,从而解决欺骗检测的泛化性问题。具有度量学习目标的原型损失可以直接学习嵌入空间,并成为主流分类损失函数的有力替代。我们提出了一种基于挤压激励残差网络(SE-ResNet)架构并结合原型损失的防欺骗系统。我们证明,所提出的无任何数据增强的单一系统在 ASVspoof 2019 逻辑访问(LA)任务上可达到与近期最佳防欺骗系统相竞争的性能。此外,带数据增强的所提系统在 LA 任务的进度与评估阶段均优于 ASVspoof 2021 挑战最佳基线。在 ASVspoof 2019 与 2021 评估集 LA 场景下,我们相较挑战最佳基线在 min-tDCF 上分别取得相对的 68.4% 与 3.6% 的提升。
引用
@article{arxiv.2201.09470,
title = {Synthetic speech detection using meta-learning with prototypical loss},
author = {Monisankha Pal and Aditya Raikar and Ashish Panda and Sunil Kumar Kopparapu},
journal= {arXiv preprint arXiv:2201.09470},
year = {2022}
}