Conformer-Transducer、Whisper 与 wav2vec2 在改进儿童语音识别中的对比分析
计算与语言
2023-11-10 v1 人工智能
声音
音频与语音处理
摘要
自动语音识别(ASR)系统在成人语音数据上的性能已取得显著进展;然而,由于儿童与成人声音特征上的声学差异,转录儿童语音仍具挑战。本工作旨在探索使最先进的 Conformer-transducer 模型适配儿童语音以提升儿童语音识别性能的潜力。此外,将结果与先前在相同数据上微调的自监督 wav2vec2 模型及半监督多领域 Whisper 模型进行比较。我们证明,相较于未微调模型,在儿童语音上微调 Conformer-transducer 模型可显著改善儿童语音上的 ASR 性能。我们也展示了 Whisper 和 wav2vec2 在不同儿童语音数据集上的适配。我们详细的对比分析表明,在所研究的三种方法中,wav2vec2 提供了最一致的性能改进。
引用
@article{arxiv.2311.04936,
title = {A comparative analysis between Conformer-Transducer, Whisper, and wav2vec2 for improving the child speech recognition},
author = {Andrei Barcovschi and Rishabh Jain and Peter Corcoran},
journal= {arXiv preprint arXiv:2311.04936},
year = {2023}
}
备注
Presented at SpeD 23