用于语音深度伪造与欺骗检测的原始信号可微架构搜索
音频与语音处理
2021-10-07 v2
摘要
端到端的反欺骗方法,尤其是那些直接作用于原始信号的方法,正开始与其更传统的对应方法相竞争。直到最近,所有此类方法仅考虑网络参数的学习;网络架构仍是手工设计的。然而,架构同样可以被学习。本文描述了我们自动学习语音深度伪造与欺骗检测方案的网络架构的尝试,同时联合优化其他网络组件与参数,例如作用于原始信号输入的第一卷积层。所得到的原始可微架构搜索系统在 ASVspoof 2019 逻辑访问数据库上取得了 0.0517 的串联检测代价函数分数,该结果是迄今报道的最佳单系统结果之一。
引用
@article{arxiv.2107.12212,
title = {Raw Differentiable Architecture Search for Speech Deepfake and Spoofing Detection},
author = {Wanying Ge and Jose Patino and Massimiliano Todisco and Nicholas Evans},
journal= {arXiv preprint arXiv:2107.12212},
year = {2021}
}
备注
Accepted to ASVspoof 2021 Workshop