自动语音识别质量——波兰语案例研究——从Wav2Vec到Scribe ElevenLabs
音频与语音处理
2026-03-04 v1 声音
摘要
本文涉及集成大型语言模型 (LLM) 的自动语音识别 (ASR) 模型在医疗访谈中的比较研究。所提出的解决方案在波兰语基准数据集和医疗访谈数据集上进行测试。最新的ASR技术基于卷积神经网络 (CNN)、循环神经网络 (RNN) 和Transformer。大多数它们以端到端的方式工作。本文中提出的方法在Whisper模型上显示为端到端ASR与LLM在流水线中协同工作的两阶段解决方案。ASR的输出是LLM的输入。LLM是一种由ASR输出校正和改进的组件。对波兰语自动识别进行现代端到端深度学习架构与ASR混合模型的比较研究。对医疗访谈测试使用了两项最先进的ASR模型:集成了LLM的OpenAI Whisper和Scribe ElevenLabs。此外,在Mozilla Common Voice和VoxPopuli数据库上,将结果与五个更多的端到端模型(QuartzNet、FastConformer、Wav2Vec 2.0 XLSR和ESPnet Model Zoo)进行了比较。对干净音频信号、带带宽限制的信号和受损信号进行测试。所测试的模型基于词错误率 (WER) 和字符错误率 (CER) 进行评估。结果表明,Whisper模型在开源模型中表现最佳。ElevenLabs Scribe模型则在波兰语的通用基准和医疗数据上表现最佳。
关键词
引用
@article{arxiv.2603.02246,
title = {Quality of Automatic Speech Recognition -- Polish Language case study -- from Wav2Vec to Scribe ElevenLabs},
author = {Marcin Pietroń and Szymon Piórkowski and Kamil Faber and Dominik Żurek and Michał Karwatowski and Jerzy Duda and Hubert Zieliński and Piotr Lipnicki and Mikołaj Leszczuk},
journal= {arXiv preprint arXiv:2603.02246},
year = {2026}
}