中文

搭建语音与文本:通过拼音到字符预训练提升ASR中的LLM

计算与语言 2024-09-25 v1 声音 音频与语音处理

摘要

将大语言模型(LLM)与预训练语音模型集成已为自动语音识别(ASR)开辟了新方向。尽管LLM在多模态理解任务中表现出色,但有效地利用其能力进行ASR仍是一个重大挑战。本文提出了一种新颖的训练方法,以增强LLM在ASR任务中的性能。我们提出在拼音嵌入序列上进行预训练,以生成对应的中文字符。这一步使LLM能够适应从发音特征生成文本,进而接触真实语音数据。此外,我们对LoRA参数进行微调,以增强LLM对语音模态信息的理解。在AISHELL-1语料库中,我们的方法在ASR任务中相对于没有拼音到字符预训练的基线实现了9.5%的相对改进。此外, incorporating auxiliary text data for Pinyi-to-Character pre-training further boosts performance, achieving a 19.0% relative improvement.

关键词

引用

@article{arxiv.2409.16005,
  title  = {Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs},
  author = {Yang Yuhang and Peng Yizhou and Eng Siong Chng and Xionghu Zhong},
  journal= {arXiv preprint arXiv:2409.16005},
  year   = {2024}
}

备注

Accepted by ISCSLP2024-Special session-Speech Processing in LLM Era