中文

面向强 ASR 能力的 LLM 的一个极其简单的方法

计算与语言 2024-02-15 v1 人工智能 多媒体 声音 音频与语音处理

摘要

本文聚焦于使用语音基础编码器和大语言模型(LLM)解决最重要的语音处理任务之一,即自动语音识别(ASR)。近期研究采用复杂设计,如压缩语音编码器的输出时间维度、处理投影器的模态对齐,以及利用参数高效微调 LLM。我们发现,精细的设计并非必需,一个极其简单地组合即插即用语音编码器、LLM 以及唯一可训练的线性投影器即可胜任 ASR 任务。具体而言,我们对 various LLMs 和语音编码器的组合进行基准测试和探索,最终得到最优的基于 LLM 的 ASR 系统,称为 SLAM-ASR。该系统提供干净的设置和极少的任务特定设计,仅训练线性投影器。据我们所知,SLAM-ASR 在 Librispeech 基准测试中实现了 LLM-based ASR 模型的最佳性能,甚至超过了在大规模配对数据上训练的最新 LLM-based audio-universal 模型。最后,我们探讨了 LLM-based ASR 在模态对齐过程中能力的涌现。我们希望本研究能够促进扩充 LLM 跨模态能力的研究,并为 LLM-based ASR 社区指明方向。

关键词

引用

@article{arxiv.2402.08846,
  title  = {An Embarrassingly Simple Approach for LLM with Strong ASR Capacity},
  author = {Ziyang Ma and Guanrou Yang and Yifan Yang and Zhifu Gao and Jiaming Wang and Zhihao Du and Fan Yu and Qian Chen and Siqi Zheng and Shiliang Zhang and Xie Chen},
  journal= {arXiv preprint arXiv:2402.08846},
  year   = {2024}
}

备注

Working in progress and will open-source soon