中文

基于RandomSpecmix的多视角信息融合Res2Net假语音检测

声音 2023-06-28 v1 机器学习 音频与语音处理

摘要

本文提出基于随机Specmix的多视角信息融合(MPIF)Res2Net用于假语音检测(FSD)。该系统主要目的是提升模型在低质量场景下学习FSD任务精确伪造信息的能力。随机Specmix作为一种数据增强,其任务是提升模型泛化能力并增强模型定位判别信息的能力。Specmix在同一批次样本间剪切并粘贴谱图的频率维信息而不引入其他数据,这有助于模型定位真正有用的信息。同时,我们随机选取样本进行增强,以降低数据增强直接改变所有数据的影响。一旦达成助模型定位信息的目的,减少不必要信息亦很重要。MPIF-Res2Net的作用是减少冗余干扰信息。单一视角的欺骗信息总是相似的,故模型学习此类相似信息会产生冗余欺骗线索并干扰真正判别性信息。所提MPIF-Res2Net融合不同视角信息,使模型所学信息更多样,从而减少相似信息导致的冗余并避免对判别信息学习的干扰。在ASVspoof 2021 LA数据集上的结果证明了所提方法的有效性,分别取得3.29%的EER与0.2557的min-tDCF。

关键词

引用

@article{arxiv.2306.15389,
  title  = {Multi-perspective Information Fusion Res2Net with RandomSpecmix for Fake Speech Detection},
  author = {Shunbo Dong and Jun Xue and Cunhang Fan and Kang Zhu and Yujie Chen and Zhao Lv},
  journal= {arXiv preprint arXiv:2306.15389},
  year   = {2023}
}

备注

Accepted by DADA2023