ViSpeechFormer:面向越南语自动语音识别的音素方法
计算与语言
2026-02-11 v1
摘要
越南语采用音标拼写方案,即每个 grapheme 对应至多一个 phoneme,反之亦然。利用这种高水平的 grapheme-phoneme 透明度,我们提出 ViSpeechFormer(\textbf{Vi}etnamese \textbf{Speech} Trans\textbf{Former}),即一种基于音素的方法用于越南语自动语音识别(ASR)。据我们所知,这是首个显式建模音素表示的越南语 ASR 框架。在两个公开可得的越南语 ASR 数据集上进行实验,结果显示 ViSpeechFormer 取得了强劲的性能,能更好地泛化至 out-of-vocabulary 词,训练偏差影响也更小。这种音素基方法同样适用于具有音标拼写方案的其他语言。本文接受后将公开代码。
引用
@article{arxiv.2602.10003,
title = {ViSpeechFormer: A Phonemic Approach for Vietnamese Automatic Speech Recognition},
author = {Khoa Anh Nguyen and Long Minh Hoang and Nghia Hieu Nguyen and Luan Thanh Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2602.10003},
year = {2026}
}