利用 Ghost-VLAD 池化识别印度语言
计算与语言
2020-02-06 v1 机器学习
音频与语音处理
摘要
在这项工作中,我们考虑印度语言,提出一种新的用于语言识别的池化策略。其思想是获取任意变长音频的语句级特征以实现鲁棒的语言识别。我们使用 GhostVLAD 方法,通过跨时间聚合局部帧级特征,为任意变长输入音频生成语句级特征向量。所生成的特征向量被证明具有非常好的语言判别特征,并有助于在语言识别任务上取得当前最优结果。我们在 635 小时的 7 种印度语言音频数据上进行实验。我们的方法在 F1 分数上比先前的 SOTA x-vector [11] 方法绝对提升 1.88%,并在留出测试数据上达到 98.43% 的 F1 分数。我们将我们的系统与多种池化方法进行比较,表明 GhostVLAD 是该任务的最佳池化方法。我们还提供了使用 Ghost-VLAD 池化生成的语句级嵌入的可视化,并表明该方法创建的嵌入具有非常好的语言判别特征。
引用
@article{arxiv.2002.01664,
title = {Identification of Indian Languages using Ghost-VLAD pooling},
author = {Krishna D N and Ankita Patil and M. S. P Raj and Sai Prasad H S and Prabhu Aashish Garapati},
journal= {arXiv preprint arXiv:2002.01664},
year = {2020}
}