用于文本相关与无关说话人识别鲁棒组合的嵌入融合网络
机器学习
2021-06-21 v1 计算与语言
声音
音频与语音处理
摘要
通过基于其语音输入隐式识别用户,说话人识别实现了许多下游应用,例如个性化系统行为和加速购物结账。根据语音内容是否受限,可使用文本相关(TD)和文本无关(TI)说话人识别模型。我们希望通过集成系统结合两类模型的优势以做出更可靠的预测。然而,任何此类组合方法必须对不完整输入具有鲁棒性,即当 TD 或 TI 输入缺失时。作为解决方案,我们提出了一种嵌入融合网络 foenet 架构,将联合学习与神经注意力相结合。我们在语音助手输入数据集上将 foenet 与四种竞争性基线方法进行比较,并表明其在不完整输入存在时尤其比基线和分数融合方法达到更高准确率。
引用
@article{arxiv.2106.10169,
title = {Fusion of Embeddings Networks for Robust Combination of Text Dependent and Independent Speaker Recognition},
author = {Ruirui Li and Chelsea J. -T. Ju and Zeya Chen and Hongda Mao and Oguz Elibol and Andreas Stolcke},
journal= {arXiv preprint arXiv:2106.10169},
year = {2021}
}