中文

一种用于端到端语音反欺骗的多分辨率前端

声音 2021-10-12 v1 音频与语音处理

摘要

在涉及语音信号分类的任务(例如语音反欺骗)中,最优时频分辨率的选择通常困难但重要。不同时间频率分辨率选择所带来的性能差异,可能堪比不同模型架构之间的差异,这使得在提出并引入新网络架构作为分类器时,难以判断改进究竟源自何处。本文提出一种用于端到端分类框架中特征提取的多分辨率前端。给定分类任务目标,多种时频分辨率的最优加权组合将被自动学习。以不同时间频率分辨率提取的特征被加权并拼接作为后续网络的输入,其中权重由受压缩激励网络(SENet)中加权块启发的可学习神经网络预测。此外,通过剪枝相对不重要者来精炼所选时频分辨率,降低了模型的复杂度和规模。所提方法在 ASVSpoof 2019 的语音反欺骗任务上进行了评估,并通过与类似基线比较证实了其优越性。

关键词

引用

@article{arxiv.2110.05087,
  title  = {A Multi-Resolution Front-End for End-to-End Speech Anti-Spoofing},
  author = {Wei Liu and Meng Sun and Xiongwei Zhang and Hugo Van hamme and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2110.05087},
  year   = {2021}
}

备注

submitted to ICASSP 2022