DeepVOX:从原始音频中发现特征以用于非理想音频信号中的说话人识别
音频与语音处理
2022-06-14 v2 机器学习
摘要
自动说话人识别算法通常使用预定义的滤波器组(如 Mel 频率滤波器组和 Gammatone 滤波器组)来表征语音音频。然而,据观察,使用这些滤波器组提取的特征对各种音频退化缺乏鲁棒性。在本工作中,我们提出了一种基于深度学习的技术,从海量语音音频中推导滤波器组设计。该滤波器组旨在提取对非理想音频条件(如退化、短时和多语种语音)具有鲁棒性的特征。为此,设计了一维卷积神经网络直接从原始语音音频中学习称为 DeepVOX 的时域滤波器组。其次,开发了一种自适应三元组挖掘技术,以高效挖掘最适合训练该滤波器组的数据样本。第三,对 DeepVOX 滤波器组的详细消融研究揭示了提取特征中同时包含声源和声道特征。在 VOXCeleb2、NIST SRE 2008、2010 和 2018 以及 Fisher 语音数据集上的实验结果证明了 DeepVOX 特征在各种退化、短时和多语种语音中的有效性。DeepVOX 特征还被证明能够提升现有说话人识别算法的性能,如 xVector-PLDA 和 iVector-PLDA。
引用
@article{arxiv.2008.11668,
title = {DeepVOX: Discovering Features from Raw Audio for Speaker Recognition in Non-ideal Audio Signals},
author = {Anurag Chowdhury and Arun Ross},
journal= {arXiv preprint arXiv:2008.11668},
year = {2022}
}