中文

SALMONN:面向大语言模型的通用听觉能力

声音 2024-04-09 v2 计算与语言 音频与语音处理

摘要

听觉可以说是物理世界中人工智能(AI)智能体的一项基本能力,其指对至少由三类声音——语音、音频事件与音乐——组成的通用听觉信息的感知与理解。在本文中,我们提出SALMONN(speech audio language music open neural network,语音音频语言音乐开放神经网络),通过将预训练的基于文本的大语言模型(LLM)与语音及音频编码器集成至单一多模态模型中构建。SALMONN使LLM能够直接处理并理解通用音频输入,并在训练所用的若干语音与音频任务上取得有竞争力的性能,如自动语音识别与翻译、基于听觉信息的问答、情感识别、说话人验证以及音乐与音频描述等。SALMONN还具有训练中未见的一系列涌现能力,包括但不限于向未训练语言的语音翻译、基于语音的槽填充、口语查询问答、基于音频的故事生成以及语音音频协同推理等。我们研究了跨模态涌现能力的存在,并提出了一种新颖的少样本激活微调方法来激活此类能力。据我们所知,SALMONN是此类首个模型,可视为迈向具备通用听觉能力的AI的一步。源代码、模型检查点与数据可在 https://github.com/bytedance/SALMONN 获取。

关键词

引用

@article{arxiv.2310.13289,
  title  = {SALMONN: Towards Generic Hearing Abilities for Large Language Models},
  author = {Changli Tang and Wenyi Yu and Guangzhi Sun and Xianzhao Chen and Tian Tan and Wei Li and Lu Lu and Zejun Ma and Chao Zhang},
  journal= {arXiv preprint arXiv:2310.13289},
  year   = {2024}
}