LLM-based ASR 与 Whisper 在低资源和代码切换场景中的比较研究
人工智能
2024-12-05 v2 计算与语言
声音
音频与语音处理
摘要
大型语言模型 (LLM) 在 diverse NLP 任务中展现出卓越的性能,其与语音编码器的集成正快速成为自动语音识别 (ASR) 领域的主导趋势。以往的工作主要集中在利用 LLM 进行英语和中文语音识别。然而,LLM 在解决低资源场景下语音识别挑战方面的潜力尚未得到充分探索。鉴于此,本 work 旨在探索 LLM 在低资源 ASR 和普通话-英语代码切换 ASR 中的能力。我们还对比评估了基于 LLM 的 ASR 系统与 Whisper 模型的识别性能。大量实验表明,在低资源 ASR 中,LLM-based ASR 相对于 Whisper 模型实现了 12.8% 的相对提升,而在普通话-英语代码切换 ASR 中,Whisper 模型表现更好。我们希望本研究能为低资源场景下的 ASR 提供参考。
引用
@article{arxiv.2412.00721,
title = {A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario},
author = {Zheshu Song and Ziyang Ma and Yifan Yang and Jianheng Zhuo and Xie Chen},
journal= {arXiv preprint arXiv:2412.00721},
year = {2024}
}
备注
This work hasn't been finished yet