STC 用于 VOiCES From a Distance 挑战赛的说话人识别系统
声音
2019-04-15 v1 计算与语言
机器学习
音频与语音处理
摘要
本文介绍了语音技术中心(STC)提交给 2019 年 VOiCES From a Distance 挑战赛的说话人识别(SR)系统。该挑战赛的 SR 任务聚焦于噪声条件下单通道远距离/远场音频中的说话人识别问题。在这项工作中,我们研究了用于说话人嵌入提取的不同深度神经网络架构以解决该任务。我们表明,具有残差帧级连接的深度网络优于更浅的架构。本工作研究了基于简单能量的语音活动检测器(SAD)和基于自动语音识别(ASR)的 SAD。我们还解决了用于鲁棒嵌入提取器训练的数据准备问题。数据增强的混响是使用自动房间脉冲响应生成器进行的。在我们的系统中,我们使用判别训练的余弦相似度度量学习模型作为嵌入后端。对我们使用的每个独立子系统都应用了分数归一化过程。我们最终提交的系统基于不同子系统的融合。在 VOiCES 开发集和评估集上获得的结果证明了所提出系统在处理噪声条件下远距离/远场音频时的有效性和鲁棒性。
引用
@article{arxiv.1904.06093,
title = {STC Speaker Recognition Systems for the VOiCES From a Distance Challenge},
author = {Sergey Novoselov and Aleksei Gusev and Artem Ivanov and Timur Pekhovsky and Andrey Shulipa and Galina Lavrentyeva and Vladimir Volokhov and Alexandr Kozlov},
journal= {arXiv preprint arXiv:1904.06093},
year = {2019}
}
备注
Submitted to Interspeech 2019, Graz, Austria