利用自监督模型实现自动 whispered speech 识别
音频与语音处理
2024-11-05 v2 声音
摘要
在自动语音识别中,任何改变语音声学特性的因素都会给系统性能带来挑战。本文提出一种新方法,用于爱尔兰方言下的 whispered speech 自动识别,基于自监督 WavLM 模型。传统的自动语音识别系统往往无法准确识别 whispered speech,因为其具有独特的声学特性且相关训练数据稀缺。为此,我们利用预训练的 WavLM 模型,结合来自 wTIMIT 和 CHAINS 数据集中包含英语在新加坡和爱尔兰方言的 whispered 与正常语音数据进行微调。我们的基线评估显示,OpenAI Whisper 模型在 whispered speech 上的词错误率(WER)为 18.8%,字符错误率(CER)为 4.24%。相比之下,基于 WavLM 的系统显著提升性能,WER 为 9.22%,CER 为 2.59%。这些结果表明了本方法在识别 whispered speech 方面的有效性,强调了为鲁棒的自动语音识别系统建模的重要性。本研究为开发针对 whisper 和方言的挑战性语音识别解决方案提供了有价值的见解。本论文的源代码已公开获取。
引用
@article{arxiv.2407.21211,
title = {Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition},
author = {Aref Farhadipour and Homa Asadi and Volker Dellwo},
journal= {arXiv preprint arXiv:2407.21211},
year = {2024}
}
备注
This paper was accepted at the ICCKE2024 conference