用于野外端到端说话人识别的孪生胶囊网络
音频与语音处理
2020-09-29 v1 机器学习
声音
摘要
我们提出了一种用于野外说话人确认的端到端深度模型。我们的模型使用thin-ResNet从语音中提取说话人嵌入,并使用孪生胶囊网络(Siamese capsule network)和动态路由作为后端计算嵌入间的相似度分数。我们在模型上开展了一系列实验并与SOTA方案比较,表明我们的模型以显著更少的训练数据量优于所有其他模型。我们还进行了额外实验以研究不同说话人嵌入对孪生胶囊网络的影响。我们展示最佳性能通过使用直接来自前端特征聚合模块的嵌入并将其通过动态路由传递至更高层胶囊而实现。
引用
@article{arxiv.2009.13480,
title = {Siamese Capsule Network for End-to-End Speaker Recognition In The Wild},
author = {Amirhossein Hajavi and Ali Etemad},
journal= {arXiv preprint arXiv:2009.13480},
year = {2020}
}
备注
Submitted to ICASSP2021