中文

Ideal-LLM:集成双编码器与语言自适应大语言模型的多语言语音转文本模型

音频与语音处理 2024-09-18 v1 声音

摘要

通过连接器将音频编码器与大语言模型(LLM)集成,使这些模型能够处理和理解音频模态,显著增强了语音转文本任务,包括自动语音识别(ASR)和自动语音翻译(AST)。然而,这些方法在多语言环境中往往忽视了语言适应这一关键方面,仅依赖多语言数据而未充分解决语言差异问题。为弥补这一不足,我们提出了 Ideal-LLM 模型,该模型采用双多语言编码器来丰富语言特征信息,并利用语言自适应连接器来针对性地适应每种语言。通过利用 Whisper 和 MMS 编码器的互补优势,我们的方法确保了更丰富的多语言表示。此外,语言自适应连接器通过为每种语言定制的语言权重选择器增强了模态转换。实验结果表明,Ideal-LLM 显著提升了 ASR 性能,与集成 LLM 的标准语音编码器相比,平均词错误率相对降低了 32.6%,并在 AST 任务上取得了 36.78 的平均 BLEU 分数。

关键词

引用

@article{arxiv.2409.11214,
  title  = {Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text},
  author = {Hongfei Xue and Wei Ren and Xuelong Geng and Kun Wei and Longhao Li and Qijie Shao and Linju Yang and Kai Diao and Lei Xie},
  journal= {arXiv preprint arXiv:2409.11214},
  year   = {2024}
}

备注

5 pages, 3 figures, submitted to ICASSP 2025