面向牙买加帕托阿音乐转录的鲁棒语音识别
音频与语音处理
2025-07-24 v1 人工智能
计算与语言
摘要
尽管牙买加帕托阿语是一种广泛使用的语言,但当前的语音识别系统在处理帕托阿音乐时表现不佳,生成的字幕不准确,限制了可访问性并阻碍了下游应用。在这项工作中,我们采用以数据为中心的方法来解决这一问题,精心整理了超过 40 小时的人工转录帕托阿音乐。我们使用该数据集微调了最先进的自动语音识别 (ASR) 模型,并利用结果制定了 Whisper 模型在牙买加帕托阿语音上的性能缩放定律。我们希望这项工作能对牙买加帕托阿音乐的可访问性以及牙买加帕托阿语语言建模的未来产生积极影响。
引用
@article{arxiv.2507.16834,
title = {Towards Robust Speech Recognition for Jamaican Patois Music Transcription},
author = {Jordan Madden and Matthew Stone and Dimitri Johnson and Daniel Geddez},
journal= {arXiv preprint arXiv:2507.16834},
year = {2025}
}