一种用于短片段说话人识别的深度神经网络
音频与语音处理
2019-07-25 v1 机器学习
声音
机器学习
摘要
当今的交互设备如智能手机助手和智能音箱常处理短时长语音片段。因此,集成于此类设备中的说话人识别系统若采用能够对短时长话语执行识别任务的模型,将更为适用。本文提出一种新深度神经网络UtterIdNet,能够对短语音片段进行说话人识别。我们所提模型利用一种新颖架构,通过对短语音片段中信息的有效增强利用,使其适用于短片段说话人识别。UtterIdNet已在VoxCeleb数据集(说话人识别的最新基准)上训练和测试。针对不同片段时长的评估显示,其对短片段具有一致且稳定的性能,并在2秒、1秒尤其是亚秒级时长(250 ms和500 ms)片段上较先前模型有显著改进。
引用
@article{arxiv.1907.10420,
title = {A Deep Neural Network for Short-Segment Speaker Recognition},
author = {Amirhossein Hajavi and Ali Etemad},
journal= {arXiv preprint arXiv:1907.10420},
year = {2019}
}
备注
Accepted in Interspeech 2019