中文

揭示基于大语言模型的ASR在中文开源数据集上的潜力

声音 2024-11-06 v3 计算与语言 音频与语音处理

摘要

大语言模型(LLM)在各种NLP任务中已展现出无与伦比的有效性,将LLM与自动语音识别(ASR)集成正在成为主流范式。基于这一势头,我们的研究在一个大型开源中文数据集上对这一范式进行了深入检验。具体而言,我们的研究旨在评估在语音基础编码器-LLM ASR范式背景下,语音编码器、LLM和投影模块的各种配置的影响。此外,我们引入了一种三阶段训练方法,专门用于增强模型对齐听觉和文本信息的能力。通过实施这种方法,并结合ASR组件的策略性集成,我们在AISHELL-1、Test_Net和Test_Meeting测试集上取得了SOTA性能。我们的分析为未来基于LLM的ASR系统研究提供了实证基础,并为使用中文数据集优化性能提供了见解。我们将公开发布用于数据准备、训练、推理和评分的所有脚本,以及预训练模型和训练日志,以促进可复现的研究。

关键词

引用

@article{arxiv.2405.02132,
  title  = {Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets},
  author = {Xuelong Geng and Tianyi Xu and Kun Wei and Bingshen Mu and Hongfei Xue and He Wang and Yangze Li and Pengcheng Guo and Yuhang Dai and Longhao Li and Mingchen Shao and Lei Xie},
  journal= {arXiv preprint arXiv:2405.02132},
  year   = {2024}
}