中文

Qwen2-Audio技术报告

音频与语音处理 2024-07-16 v1 计算与语言 机器学习

摘要

我们介绍了Qwen-Audio的最新进展,一个名为Qwen2-Audio的大规模音频-语言模型,它能够接受各种音频信号输入,并根据语音指令执行音频分析或直接生成文本响应。与复杂的层次化标签不同,我们通过利用自然语言提示来处理不同的数据和任务,简化了预训练过程,并进一步扩展了数据量。我们增强了Qwen2-Audio的指令跟随能力,并为语音聊天和音频分析实现了两种不同的音频交互模式。在语音聊天模式下,用户可以自由地与Qwen2-Audio进行语音交互,无需文本输入。在音频分析模式下,用户可以在交互过程中提供音频和文本指令进行分析。请注意,我们不使用任何系统提示来在语音聊天和音频分析模式之间切换。Qwen2-Audio能够智能地理解音频中的内容,并遵循语音命令做出适当响应。例如,在一个同时包含声音、多人对话和语音命令的音频片段中,Qwen2-Audio可以直接理解该命令,并对音频进行解释和响应。此外,DPO优化了模型在事实性和遵循期望行为方面的性能。根据AIR-Bench的评估结果,Qwen2-Audio在以音频为中心的指令跟随能力测试中,超越了之前的SOTA模型,如Gemini-1.5-pro。Qwen2-Audio是开源的,旨在促进多模态语言社区的发展。

关键词

引用

@article{arxiv.2407.10759,
  title  = {Qwen2-Audio Technical Report},
  author = {Yunfei Chu and Jin Xu and Qian Yang and Haojie Wei and Xipin Wei and Zhifang Guo and Yichong Leng and Yuanjun Lv and Jinzheng He and Junyang Lin and Chang Zhou and Jingren Zhou},
  journal= {arXiv preprint arXiv:2407.10759},
  year   = {2024}
}

备注

https://github.com/QwenLM/Qwen2-Audio. Checkpoints, codes and scripts will be opensoursed soon