面向真实场景说话人识别的语句级聚合方法
音频与语音处理
2019-05-21 v2 机器学习
多媒体
声音
摘要
本文的目标是“真实场景”下的说话人识别——其中语句长度可变且可能包含无关信号。为此类任务设计深度网络的关键要素包括主干(帧级)网络类型与时间聚合方法。我们提出了一种强大的说话人识别深度网络,采用“thin-ResNet”主干架构,以及基于字典的 NetVLAD 或 GhostVLAD 层来跨时间聚合特征,该网络可端到端训练。我们表明,在 VoxCeleb1 说话人识别测试集上,我们的网络以显著优势达到 SOTA 性能,同时所需参数量少于以往方法。我们还研究了语句长度对性能的影响,并得出结论:对于“真实场景”数据,较长的长度是有益的。
引用
@article{arxiv.1902.10107,
title = {Utterance-level Aggregation For Speaker Recognition In The Wild},
author = {Weidi Xie and Arsha Nagrani and Joon Son Chung and Andrew Zisserman},
journal= {arXiv preprint arXiv:1902.10107},
year = {2019}
}
备注
To appear in: International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2019. (Oral Presentation)