中文

一种具有局部与全局上下文的紧凑端到端语音语种识别模型

音频与语音处理 2023-08-14 v2 计算与语言 声音

摘要

我们介绍了 TitaNet-LID,一种基于 ContextNet 架构的紧凑端到端神经网络,用于语音语种识别(LID)。TitaNet-LID 采用一维深度可分离卷积和压缩激励(Squeeze-and-Excitation)层,以有效捕获语句内的局部与全局上下文。尽管模型规模很小,TitaNet-LID 在 VoxLingua107 数据集上取得了与最先进(state-of-the-art)模型相近的性能,而模型大小仅为后者的十分之一。此外,通过简单的微调,它可轻松适配新的声学条件和未见过的语言,在 FLEURS 基准上达到了 88.2% 的最先进准确率。我们的模型具有可扩展性,能够在准确率与速度之间实现更好的权衡。TitaNet-LID 即使在长度小于 5 秒的短语句上也表现良好,表明其对输入长度具有鲁棒性。

关键词

引用

@article{arxiv.2210.15781,
  title  = {A Compact End-to-End Model with Local and Global Context for Spoken Language Identification},
  author = {Fei Jia and Nithin Rao Koluguri and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2210.15781},
  year   = {2023}
}

备注

Accepted to INTERSPEECH 2023