中文

Solla:面向语音的 LLM 并聆听声学语境

音频与语音处理 2025-03-20 v1 计算与语言 声音

摘要

大型语言模型 (LLM) 最近显示出处理不仅仅是文本,还能处理多模态输入如语音和音频的惊人能力。然而,大多数现有模型主要关注使用文本指令分析输入信号,忽视了语音指令和音频混合作为输入的场景。为解决这些挑战,我们引入 Solla,一个新型框架旨在同时理解基于语音的问题并聆听声学语境。Solla 包含一个音频标记模块有效识别和表示音频事件,还包括一个语音识别辅助预测方法来提高对口语内容的理解。为严格评估 Solla 和其他公开可用模型,我们提出了一个新的基准数据集称为 SA-Eval,包含三个任务:音频事件分类、音频描述和音频问答。SA-Eval 包含多样化的语音指令,涵盖各种说话风格,分为易难两个难度级别,以捕捉真实世界声学条件的范围。实验结果表明,Solla 在易难测试集上表现出与或优于基线模型的水平,凸显了其在同时理解语音和音频方面的有效性。

关键词

引用

@article{arxiv.2503.15338,
  title  = {Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context},
  author = {Junyi Ao and Dekun Chen and Xiaohai Tian and Wenjie Feng and Jun Zhang and Lu Lu and Yuxuan Wang and Haizhou Li and Zhizheng Wu},
  journal= {arXiv preprint arXiv:2503.15338},
  year   = {2025}
}