中文

增强印尼语自动语音识别:评估具有多样性语音变异性的多语言模型

计算与语言 2024-10-15 v2 声音 音频与语音处理

摘要

理想的语音识别模型应具备在各种语音信号特征下准确转录的能力,包括说话风格(阅读型与自发型)、语境(正式与非正式)以及背景噪声条件(干净与适度嘈杂)。构建此类模型需要大量具有多样语音特征的训练数据。目前,印尼语数据主要由阅读型、正式且干净的语音构成,导致缺乏其他语音变异性的印尼语数据。为开发印尼语自动语音识别(ASR),我们提出研究,评估最先进的语音识别模型,即 Massively Multilingual Speech(MMS)和 Whisper,并编译了一个包含印尼语多变语音的数据集以便我们的研究。我们进一步探讨了模型在不同变异性组别中的印尼语语音数据转录能力。结果表明,Whisper 微调模型在各种特征的数据集上表现最佳,显示出字错率(WER)和字符错率(CER)的降低。此外,我们发现说话风格的变异性对模型性能影响最大。

关键词

引用

@article{arxiv.2410.08828,
  title  = {Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities},
  author = {Aulia Adila and Dessi Lestari and Ayu Purwarianti and Dipta Tanaya and Kurniawati Azizah and Sakriani Sakti},
  journal= {arXiv preprint arXiv:2410.08828},
  year   = {2024}
}

备注

Accepted at O-COCOSDA 2024