WhisperX:长音频的时间精确语音转写
声音
2023-07-12 v2 音频与语音处理
摘要
大规模弱监督语音识别模型,如 Whisper,已在跨领域与跨语言的语音识别上展现出令人印象深刻的成果。然而,它们通过缓冲或滑动窗口方法应用于长音频转写时,容易出现漂移、幻觉与重复,并且因其顺序特性而妨碍批处理转写。此外,对应各话语的时间戳易不准确,且词级时间戳无法开箱即用。为克服这些挑战,我们提出 WhisperX,一种利用语音活动检测与强制音素对齐、具有词级时间戳的时间精确语音识别系统。据此,我们在长音频转写与词分割基准上展示了最先进的性能。此外,我们表明以所提 VAD Cut & Merge 策略对音频预分割可提升转写质量,并通过批处理推理实现十二倍转写加速。
引用
@article{arxiv.2303.00747,
title = {WhisperX: Time-Accurate Speech Transcription of Long-Form Audio},
author = {Max Bain and Jaesung Huh and Tengda Han and Andrew Zisserman},
journal= {arXiv preprint arXiv:2303.00747},
year = {2023}
}
备注
Accepted to INTERSPEECH 2023