中文

面向英汉语码转换儿童导向语音的口语语言识别系统

音频与语音处理 2023-10-05 v1 声音

摘要

本工作致力于改进口语语言识别(LangId)系统,以应对一项挑战,该挑战旨在开发稳健的语言识别系统,使其能够可靠处理通过 Zoom 收集的非标准、带口音(新加坡口音)、自发语码转换以及儿童导向语音。我们提出了一种两阶段基于 Encoder-Decoder 的 E2E 模型。编码器模块由具有全局上下文的 Squeeze-and-Excitation(SE)层的 1D1D 深度可分离卷积组成。解码器模块使用注意力时间池化机制以获得固定长度的与时间无关的特征表示。该模型的总参数量约为 22.1 M,与使用某些大规模预训练语音模型相比相对轻量。我们在封闭赛道中取得了 15.6% 的 EER,在开放赛道中取得了 11.1% 的 EER(基线系统为 22.1%)。我们还从 YouTube 视频(包含新加坡说话者)中整理了额外的 LangId 数据,这些数据将公开发布。

关键词

引用

@article{arxiv.2306.00736,
  title  = {Spoken Language Identification System for English-Mandarin Code-Switching Child-Directed Speech},
  author = {Shashi Kant Gupta and Sushant Hiray and Prashant Kukde},
  journal= {arXiv preprint arXiv:2306.00736},
  year   = {2023}
}

备注

Accepted by Interspeech 2023, 5 pages, 1 figure, 4 tables