双语与三语 Wav2Vec 模型用于多语言口述历史档案自动语音识别的比较分析
计算与语言
2024-09-26 v1 人工智能
摘要
本文比较了单语 Wav2Vec 2.0 模型与 various 多语言模型,以评估在包含大量混合语言句子的独特口述历史档案中,语音识别性能是否能够得到提升。我们的主要目标是推动该独特数据集的研究,这是我们文化遗产中极其珍贵的一部分。我们的结果表明,单语语音识别模型在大多数情况下优于多语言模型,即使在处理来自非母语者的充满混合语言句子的口述历史档案时亦如此。我们还对公共 CommonVoice 数据集进行了相同的实验,以验证我们的結果。我们通过发布我们的预训练模型为研究社区做出了贡献。
引用
@article{arxiv.2407.17160,
title = {A Comparative Analysis of Bilingual and Trilingual Wav2Vec Models for Automatic Speech Recognition in Multilingual Oral History Archives},
author = {Jan Lehečka and Josef V. Psutka and Luboš Šmídl and Pavel Ircing and Josef Psutka},
journal= {arXiv preprint arXiv:2407.17160},
year = {2024}
}
备注
Accepted to INTERSPEECH2024