BERT-LID:利用 BERT 改进口语语种识别
计算与语言
2025-01-14 v3 声音
音频与语音处理
摘要
语种识别是自动确定一段口语片段所传达的语言身份的任务。它对智能语音系统的多语言互操作性具有深远影响。尽管语种识别在中等或长时话语(>3秒)上达到了高准确率,但在短时话语(<=1秒)上的表现仍远不能令人满意。我们提出了一种基于 BERT 的语种识别系统(BERT-LID),以提升语种识别性能,尤其是在短时语音片段上。我们扩展了原始的 BERT 模型,将前端音素识别器导出的音素后验概率图(PPG)作为输入。然后,我们为其部署了最优的深度分类器以进行语种识别。我们的 BERT-LID 模型在长片段识别上能将基线准确率提高约 6.5%,在短片段识别上提高 19.9%,证明了我们的 BERT-LID 对语种识别的有效性。
引用
@article{arxiv.2203.00328,
title = {BERT-LID: Leveraging BERT to Improve Spoken Language Identification},
author = {Yuting Nie and Junhong Zhao and Wei-Qiang Zhang and Jinfeng Bai},
journal= {arXiv preprint arXiv:2203.00328},
year = {2025}
}
备注
accepted by ISCSLP 2022