中文

BERT-LID:利用 BERT 改进口语语种识别

计算与语言 2025-01-14 v3 声音 音频与语音处理

摘要

语种识别是自动确定一段口语片段所传达的语言身份的任务。它对智能语音系统的多语言互操作性具有深远影响。尽管语种识别在中等或长时话语(>3秒)上达到了高准确率,但在短时话语(<=1秒)上的表现仍远不能令人满意。我们提出了一种基于 BERT 的语种识别系统(BERT-LID),以提升语种识别性能,尤其是在短时语音片段上。我们扩展了原始的 BERT 模型,将前端音素识别器导出的音素后验概率图(PPG)作为输入。然后,我们为其部署了最优的深度分类器以进行语种识别。我们的 BERT-LID 模型在长片段识别上能将基线准确率提高约 6.5%,在短片段识别上提高 19.9%,证明了我们的 BERT-LID 对语种识别的有效性。

关键词

引用

@article{arxiv.2203.00328,
  title  = {BERT-LID: Leveraging BERT to Improve Spoken Language Identification},
  author = {Yuting Nie and Junhong Zhao and Wei-Qiang Zhang and Jinfeng Bai},
  journal= {arXiv preprint arXiv:2203.00328},
  year   = {2025}
}

备注

accepted by ISCSLP 2022