罗马字化编码用于多语言语音识别
计算与语言
2024-12-18 v2 声音
音频与语音处理
摘要
我们提出罗马字化编码用于脚本密集型语言,以优化多语言和代码切换自动语音识别 (ASR) 系统。通过在 FastConformer-RNNT 框架中采用罗马字化编码并搭配平衡拼接标记器,同时引入 Roman2Char 模块,我们显著减少了词汇表和输出维度,使更大规模的训练批次成为可能并降低内存消耗。我们的方法将声学建模与语言建模解耦,增强了系统的灵活性和适应性。在我们研究中,将该方法应用于普通话-英语 ASR,实现了 63.51% 的词汇表降低,并在 SEAME 代码切换基准测试中取得 13.72% 和 15.03% 的显著性能提升。针对普通话-韩语和普通话-日语的消融实验表明,我们的方法在处理其他脚本密集型语言方面具有强大的能力,为构建更灵活且有效的多语言 ASR 系统铺平了道路。
引用
@article{arxiv.2407.04368,
title = {Romanization Encoding For Multilingual ASR},
author = {Wen Ding and Fei Jia and Hainan Xu and Yu Xi and Junjie Lai and Boris Ginsburg},
journal= {arXiv preprint arXiv:2407.04368},
year = {2024}
}
备注
Accepted by IEEE SLT2024