中文

面向孟加拉语自动语音识别的多级嵌入 Conformer 框架

音频与语音处理 2026-01-16 v1 计算与语言

摘要

孟加拉语有超过 3 亿人使用,是一种形态丰富且资源匮乏的语言,这给自动语音识别 (ASR) 带来了挑战。本研究提出了一种用于孟加拉语 ASR 的端到端框架,该框架基于 Conformer-CTC 骨干网络,并采用多级嵌入融合机制,融合了音素、音节和词片表示。通过用这些语言嵌入丰富声学特征,该模型能够捕捉细粒度的语音线索和更高层次的上下文模式。该架构采用了早期和晚期 Conformer 阶段,预处理步骤包括静音修剪、重采样、对数梅尔谱图提取和 SpecAugment 增强。实验结果展示了该模型的强大潜力,实现了 10.01% 的词错误率 (WER) 和 5.03% 的字符错误率 (CER)。这些结果证明了将多粒度语言信息与声学建模相结合的有效性,为低资源 ASR 的开发提供了一种可扩展的方法。

关键词

引用

@article{arxiv.2601.09710,
  title  = {Multi-Level Embedding Conformer Framework for Bengali Automatic Speech Recognition},
  author = {Md. Nazmus Sakib and Golam Mahmud and Md. Maruf Bangabashi and Umme Ara Mahinur Istia and Md. Jahidul Islam and Partha Sarker and Afra Yeamini Prity},
  journal= {arXiv preprint arXiv:2601.09710},
  year   = {2026}
}