中文

基于大语言模型的零资源语音翻译与识别

计算与语言 2025-01-03 v2 音频与语音处理

摘要

尽管语音处理最近取得了进展,零资源语音翻译(ST)和自动语音识别(ASR)仍然是具有挑战性的问题。在这项工作中,我们提出利用多语言大语言模型(LLM)来执行模型从未见过配对音频-文本数据的语言的ST和ASR。我们通过使用预训练的多语言语音编码器、多语言LLM以及一个轻量级适配模块(将音频表示映射到LLM的令牌嵌入空间)来实现这一点。我们在ST和ASR中进行了多项实验,以了解如何最好地训练模型以及哪些数据对先前未见语言的性能影响最大。在ST中,我们的最佳模型在CoVoST2上对两种先前未见语言能够达到超过23的BLEU分数,而在ASR中,我们实现了高达28.2%的词错误率(WER)。我们最终表明,我们系统的性能受限于LLM以所需语言输出文本的能力。

关键词

引用

@article{arxiv.2412.18566,
  title  = {Zero-resource Speech Translation and Recognition with LLMs},
  author = {Karel Mundnich and Xing Niu and Prashant Mathur and Srikanth Ronanki and Brady Houston and Veera Raghavendra Elluru and Nilaksh Das and Zejiang Hou and Goeric Huybrechts and Anshu Bhatia and Daniel Garcia-Romero and Kyu J. Han and Katrin Kirchhoff},
  journal= {arXiv preprint arXiv:2412.18566},
  year   = {2025}
}

备注

ICASSP 2025, 5 pages, 2 figures, 2 tables