利用端到端注意力在鸡尾酒会中识别说话人
音频与语音处理
2020-08-11 v2 机器学习
摘要
在多人同时说话的场景中,准确识别说话者至关重要。本文提出一个集成了语音源提取与说话人识别的端到端系统,并提出一种通过沿通道维度对说话人预测进行最大池化来联合优化这两部分的新方法。残差注意力使我们能够学习针对说话人识别任务优化的语谱图掩码,而残差前向连接则允许具有足够大上下文窗口的膨胀卷积,以保证跨音节边界的正确流式处理。端到端训练得到的系统在双说话人广播语音混合中识别一位说话人的准确率达到 99.9%,识别两位说话人的准确率达到 93.9%,在三人场景中识别所有说话人的准确率达到 81.2%。
引用
@article{arxiv.2005.11408,
title = {Identify Speakers in Cocktail Parties with End-to-End Attention},
author = {Junzhe Zhu and Mark Hasegawa-Johnson and Leda Sari},
journal= {arXiv preprint arXiv:2005.11408},
year = {2020}
}
备注
Accepted by Interspeech 2020 for presentation; https://github.com/JunzheJosephZhu/Identify-Speakers-in-Cocktail-Parties-with-E2E-Attention