在 ASV 防伪中利用多分辨率特征图与卷积神经网络
音频与语音处理
2020-08-21 v1 声音
摘要
本文提出一种简单而有效的方法,利用多分辨率特征图与卷积神经网络(CNNs)进行自动说话人验证(ASV)中的防伪。核心思想是缓解防伪网络中常用特征图不足以构建音频片段判别性表示的问题,因为它们常由单一长度滑动窗提取。时间与频率分辨率之间的权衡限制了单一谱图中的信息。所提方法通过堆叠由不同窗长提取的多个谱图,同时改善频率分辨率与时间分辨率。它们以多通道形式送入卷积神经网络,从而能从输入信号中提取更多信息,且仅边际增加计算成本。所提方法的效率已在 ASVspoof 2019 数据库上得到验证。我们表明,在不同 CNN 架构下,所提多分辨率输入的使用一致优于分数融合。此外,计算成本保持很小。
引用
@article{arxiv.2008.08865,
title = {Using Multi-Resolution Feature Maps with Convolutional Neural Networks for Anti-Spoofing in ASV},
author = {Qiongqiong Wang and Kong Aik Lee and Takafumi Koshinaka},
journal= {arXiv preprint arXiv:2008.08865},
year = {2020}
}
备注
Odyssey 2020 (The Speaker and Language Recognition Workshop)