中文

LLM-based ASR 与 Whisper 在低资源和代码切换场景中的比较研究

人工智能 2024-12-05 v2 计算与语言 声音 音频与语音处理

摘要

大型语言模型 (LLM) 在 diverse NLP 任务中展现出卓越的性能,其与语音编码器的集成正快速成为自动语音识别 (ASR) 领域的主导趋势。以往的工作主要集中在利用 LLM 进行英语和中文语音识别。然而,LLM 在解决低资源场景下语音识别挑战方面的潜力尚未得到充分探索。鉴于此,本 work 旨在探索 LLM 在低资源 ASR 和普通话-英语代码切换 ASR 中的能力。我们还对比评估了基于 LLM 的 ASR 系统与 Whisper 模型的识别性能。大量实验表明,在低资源 ASR 中,LLM-based ASR 相对于 Whisper 模型实现了 12.8% 的相对提升,而在普通话-英语代码切换 ASR 中,Whisper 模型表现更好。我们希望本研究能为低资源场景下的 ASR 提供参考。

关键词

引用

@article{arxiv.2412.00721,
  title  = {A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario},
  author = {Zheshu Song and Ziyang Ma and Yifan Yang and Jianheng Zhuo and Xie Chen},
  journal= {arXiv preprint arXiv:2412.00721},
  year   = {2024}
}

备注

This work hasn't been finished yet