罗马尼亚语语音识别的开源国际最先进解决方案
音频与语音处理
2025-11-06 v1 人工智能
摘要
本文提出一种新的国际最先进罗马尼亚语自动语音识别 (ASR) 系统,基于 NVIDIA 的 FastConformer 架构——本文首次在罗马尼亚语语境中探索该架构。我们在大型语料库上训练模型,语料库主要来自弱监督转录,总计超过 2600 小时语音。利用包含 Connectionist Temporal Classification (CTC) 和 Token-Duration Transducer (TDT) 两个分支的混合解码器,我们评估了包括贪婪解码、ALSD 和 CTC beam search 以及 6 元 token 级语言模型的多种解码策略。我们的系统在所有罗马尼亚语评估基准(包括读音、非正式说话及特定领域语音)中均实现了国际最先进性能,相较于前最佳系统实现了最高 27% 的相对 WER 降低。除了提升的转录准确率外,我们的方法还展示了实际的解码效率,适用于研究和部署于低延迟 ASR 应用。
引用
@article{arxiv.2511.03361,
title = {Open Source State-Of-the-Art Solution for Romanian Speech Recognition},
author = {Gabriel Pirlogeanu and Alexandru-Lucian Georgescu and Horia Cucu},
journal= {arXiv preprint arXiv:2511.03361},
year = {2025}
}
备注
13th Conference on Speech Technology and Human-Computer Dialogue (SpeD 2025), Cluj-Napoca, Romania