中文

全自动端到端伪造音频检测

声音 2022-08-23 v1 人工智能 音频与语音处理

摘要

现有的伪造音频检测系统往往依赖专家经验设计声学特征或手动设计网络结构的超参数。然而,人工调整参数会对结果产生较为明显的影响,几乎不可能手动设定最佳参数组合。因此,本文提出一种全自动端到端伪造音频检测方法。我们首先使用 wav2vec 预训练模型获取语音的高层表示。此外,对于网络结构,我们使用名为 light-DARTS 的可微分架构搜索(DARTS)改进版本。它在自动学习和优化由卷积操作和残差块组成的复杂神经结构的同时学习深度语音表示。在 ASVspoof 2019 LA 数据集上的实验结果表明,我们提出的系统取得了 1.08% 的等错误率(EER),优于当前最先进的单系统。

关键词

引用

@article{arxiv.2208.09618,
  title  = {Fully Automated End-to-End Fake Audio Detection},
  author = {Chenglong Wang and Jiangyan Yi and Jianhua Tao and Haiyang Sun and Xun Chen and Zhengkun Tian and Haoxin Ma and Cunhang Fan and Ruibo Fu},
  journal= {arXiv preprint arXiv:2208.09618},
  year   = {2022}
}