中文

三元组熵损失:提升短语音语种识别系统的泛化能力

声音 2020-12-08 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

我们提出若干方法以提升语种识别(LID)系统对新说话人及新领域的泛化能力。这些方法包括谱增强(训练时对谱图在频率或时间带进行掩码)以及在 Imagenet 数据集上预训练的 CNN 架构。本文还引入了新颖的三元组熵损失(Triplet Entropy Loss)训练方法,即同时使用交叉熵损失与三元组损失训练网络。研究发现三种方法均提升了模型的泛化能力,尽管提升并不显著。尽管使用三元组熵损失训练的模型对语言有更好的理解且准确率更高,但模型似乎仍是在记忆谱图中出现的词模式,而非学习语言的精细差异。研究表明三元组熵损失具有很大潜力,应进一步研究,不仅用于语种识别任务,也用于任何分类任务。

关键词

引用

@article{arxiv.2012.03775,
  title  = {Triplet Entropy Loss: Improving The Generalisation of Short Speech Language Identification Systems},
  author = {Ruan van der Merwe},
  journal= {arXiv preprint arXiv:2012.03775},
  year   = {2020}
}

备注

22 pages, 26 figures, Code available at https://github.com/ruanvdmerwe/triplet-entropy-loss