哪一个更好?Wav2Vec 还是 Whisper?在巴迪尼库尔什语语音识别中的应用比较
计算与语言
2025-08-14 v1
摘要
语音到文本(STT)系统在广泛的应用场景中可用。它们在许多语言中可用,水平各异。尽管库尔什语从处理角度被视为资源较少的语言,但某些库尔什方言(如中央库尔什语 Sorani)已有语音识别。然而,这并未应用于其他库尔什方言,如巴迪尼和哈拉米。本研究旨在弥合这一差距。巴迪尼约有两百万使用者,STT 系统可帮助其社区使用移动和计算机技术,同时提升其方言的全球可见度。我们旨在基于巴迪尼语的语音创建语言模型并评估其性能。为涵盖对话方面,确保语法准确性,以及准备好的转录,我们选用了巴迪尼儿童故事书,包含八本书和 78 篇故事作为文本输入。六位叙述者叙述了这些书,结果约为 17 小时的录音。我们清理、分割和标记了输入。预处理产生了近 15 小时的语音,包括 19193 个片段和 25221 个单词。我们使用 Wav2Vec2-Large-XLSR-53 和 Whisper-small 开发语言模型。实验表明,基于 Wav2Vec2-Large-XLSR-53 模型的转录过程在可读性和准确性方面显著优于 Whisper-small 模型,分别为 90.38% 和 65.45% 可读性,82.67% 和 53.17% 准确性。
引用
@article{arxiv.2508.09957,
title = {Which one Performs Better? Wav2Vec or Whisper? Applying both in Badini Kurdish Speech to Text (BKSTT)},
author = {Renas Adnan and Hossein Hassani},
journal= {arXiv preprint arXiv:2508.09957},
year = {2025}
}
备注
21 pages, 20 figures, 7 tables