面向短语音远场说话人识别的深度说话人嵌入方法
声音
2020-02-17 v1 计算与语言
音频与语音处理
机器学习
摘要
基于深度说话人嵌入的说话人识别系统,根据早期 NIST SRE(说话人识别评测)数据集所得结果,在受控条件下已取得显著性能。从实际角度看,考虑到对虚拟助手(如 Amazon Alexa、Google Home、AppleSiri 等)兴趣的增加,在非受控噪声环境条件下对短语音进行说话人验证是最具挑战性且需求极高的任务之一。本文提出旨在实现两个目标的方法:a) 在存在环境噪声、混响的情况下提升远场说话人验证系统质量;b) 降低系统对短语音的质量退化。为此,我们考虑了基于 TDNN(时延神经网络)与 ResNet(残差神经网络)块的深度神经网络架构。我们试验了最先进的嵌入提取器及其训练流程。所得结果证实,在长时与短时语音的说话人验证质量方面,ResNet 架构均优于标准 x-vector 方法。我们还研究了语音活动检测器、不同打分模型、自适应与分数归一化技术的影响。实验结果基于 VoxCeleb1、VoxCeleb2 和 VOiCES 数据集的公开数据与验证协议给出。
引用
@article{arxiv.2002.06033,
title = {Deep Speaker Embeddings for Far-Field Speaker Recognition on Short Utterances},
author = {Aleksei Gusev and Vladimir Volokhov and Tseren Andzhukaev and Sergey Novoselov and Galina Lavrentyeva and Marina Volkova and Alice Gazizullina and Andrey Shulipa and Artem Gorlanov and Anastasia Avdeeva and Artem Ivanov and Alexander Kozlov and Timur Pekhovsky and Yuri Matveev},
journal= {arXiv preprint arXiv:2002.06033},
year = {2020}
}
备注
Submitted to Odyssey 2020