面向孟加拉语自动语音识别的多级嵌入 Conformer 框架
音频与语音处理
2026-01-16 v1 计算与语言
摘要
孟加拉语有超过 3 亿人使用,是一种形态丰富且资源匮乏的语言,这给自动语音识别 (ASR) 带来了挑战。本研究提出了一种用于孟加拉语 ASR 的端到端框架,该框架基于 Conformer-CTC 骨干网络,并采用多级嵌入融合机制,融合了音素、音节和词片表示。通过用这些语言嵌入丰富声学特征,该模型能够捕捉细粒度的语音线索和更高层次的上下文模式。该架构采用了早期和晚期 Conformer 阶段,预处理步骤包括静音修剪、重采样、对数梅尔谱图提取和 SpecAugment 增强。实验结果展示了该模型的强大潜力,实现了 10.01% 的词错误率 (WER) 和 5.03% 的字符错误率 (CER)。这些结果证明了将多粒度语言信息与声学建模相结合的有效性,为低资源 ASR 的开发提供了一种可扩展的方法。
引用
@article{arxiv.2601.09710,
title = {Multi-Level Embedding Conformer Framework for Bengali Automatic Speech Recognition},
author = {Md. Nazmus Sakib and Golam Mahmud and Md. Maruf Bangabashi and Umme Ara Mahinur Istia and Md. Jahidul Islam and Partha Sarker and Afra Yeamini Prity},
journal= {arXiv preprint arXiv:2601.09710},
year = {2026}
}