LAMA-UT:通过正字统一和语言特定转写实现语言无关多语言语音识别
摘要
构建一个在各种语言上性能均衡的通用多语言自动语音识别 (ASR) 模型长期以来都面临挑战 due to its inherent difficulties。为解决此任务,我们引入了通过正字统一和语言特定转写 (LAMA-UT) 实现的 Language-Agnostic Multilingual ASR pipeline。LAMA-UT 在无需任何语言特定模块的情况下即可匹配 state-of-the-art 模型在最小数据量上的性能。我们的 pipeline 包含两个关键步骤。首先,我们利用通用转录生成器将正字特征统一为罗马字形式,并捕获 diverse 语言中 common 语音特征。其次,我们利用通用转换器将这些通用转录转换为 language-specific 形式。在实验中,我们展示了利用 universal transcribing 进行大规模多语言 ASR 的有效性。我们的 pipeline 相对于 Whisper 实现了相对 error reduction rate 为 45%,尽管仅 trained on only 0.1% of Whisper's training data,仍与 MMS 的性能相当。此外,我们的 pipeline 不依赖于任何 language-specific 模块。然而,它在使用 additional language-specific lexicons 和 language models 的 zero-shot ASR 方法的性能上与之相当。我们预计该 framework 将作为灵活的多语言 ASR 系统的基石,能够即使在未见语言上也具备 generalizability。
引用
@article{arxiv.2412.15299,
title = {LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration},
author = {Sangmin Lee and Woo-Jin Chung and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2412.15299},
year = {2025}
}
备注
Accepted to AAAI 2025 (Oral Presentation)