中文

Qwen-Audio:通过统一大规模音频-语言模型推进通用音频理解

音频与语音处理 2023-12-22 v2 计算与语言 机器学习

摘要

近来,遵循指令的音频-语言模型因与人类进行音频交互而受到广泛关注。然而,缺乏能够处理多样音频类型与任务的预训练音频模型阻碍了该领域的进展。因此,大多数现有工作仅能支持有限的交互能力。本文中,我们开发了 Qwen-Audio 模型,并通过将音频-语言预训练规模扩大至覆盖超过 30 项任务及各种音频类型(如人类语音、自然声音、音乐和歌曲)来解决这一局限,以促进通用音频理解能力。然而,直接联合训练所有任务与数据集会导致干扰问题,因为不同数据集关联的文本标签由于任务侧重、语言、标注粒度及文本结构的差异而表现出显著变化。为克服这一对多的干扰,我们精心设计了多任务训练框架,通过对解码器条件化一系列分层标签,分别通过共享与指定标签来鼓励知识共享并避免干扰。值得注意的是,Qwen-Audio 在多样基准任务上取得了令人印象深刻的性能,无需任何任务特定微调,便超越了其同类模型。基于 Qwen-Audio 的能力,我们进一步开发了 Qwen-Audio-Chat,其允许来自各种音频与文本的输入,支持多轮对话并适配多种以音频为中心的场景。

关键词

引用

@article{arxiv.2311.07919,
  title  = {Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models},
  author = {Yunfei Chu and Jin Xu and Xiaohuan Zhou and Qian Yang and Shiliang Zhang and Zhijie Yan and Chang Zhou and Jingren Zhou},
  journal= {arXiv preprint arXiv:2311.07919},
  year   = {2023}
}

备注

The code, checkpoints and demo are released at https://github.com/QwenLM/Qwen-Audio