基于余弦师生学习的说话人嵌入短语音补偿方法用于说话人验证
音频与语音处理
2019-04-11 v2 人工智能
声音
摘要
输入语音时长过短是降低说话人验证系统性能的最关键威胁之一。本研究旨在开发一个文本无关的集成说话人验证系统,可处理时长在2秒或更短的短语音输入。我们为此提出一种师生学习框架的方法,据我们所知这是首次应用于短语音补偿。所提系统的核心概念是在提取说话人嵌入的整个网络中进行补偿(主要在音素级),而非在提取说话人嵌入后通过独立系统补偿。在所提架构中,使用卷积层提取音素级特征,每个特征表示130毫秒的片段。门控循环单元层利用音素级特征提取语句级特征。所提方法还采用了一种新的师生学习目标函数,同时考虑输出层的Kullback-Leibler散度和说话人嵌入层的余弦距离。实验使用以原始波形为输入并在VoxCeleb1数据集上输出说话人嵌入的深度神经网络进行。所提模型可补偿因时长缩短导致的约65%的性能下降。
引用
@article{arxiv.1810.10884,
title = {Short utterance compensation in speaker verification via cosine-based teacher-student learning of speaker embeddings},
author = {Jee-weon Jung and Hee-soo Heo and Hye-jin Shim and Ha-jin Yu},
journal= {arXiv preprint arXiv:1810.10884},
year = {2019}
}
备注
5 pages, 2 figures, submitted to Interspeech 2019 as a conference paper