中文

AudioGPT:理解并生成语音、音乐、声音与说话头

计算与语言 2023-04-26 v1 人工智能 声音 音频与语音处理

摘要

大语言模型(LLMs)已在多种领域和任务中展现出非凡能力,挑战了我们对学习与认知的理解。尽管近期取得进展,当前的 LLMs 仍无法处理复杂音频信息或进行口语对话(如 Siri 或 Alexa)。本工作中,我们提出一个名为 AudioGPT 的多模态 AI 系统,其通过以下方式补充 LLMs(即 ChatGPT):1)利用基础模型处理复杂音频信息并解决大量理解与生成任务;2)通过输入/输出接口(ASR、TTS)支持口语对话。随着对评估多模态 LLMs 的人类意图理解与同基础模型协作的需求日益增长,我们梳理了相关原则与流程,并从一致性、能力和鲁棒性方面对 AudioGPT 进行了测试。实验结果表明,AudioGPT 能够在多轮对话中解决涉及语音、音乐、声音及说话头理解与生成的 AI 任务,从而以空前便利赋能人类创作丰富多样的音频内容。我们的系统已公开于 \url{https://github.com/AIGC-Audio/AudioGPT}。

关键词

引用

@article{arxiv.2304.12995,
  title  = {AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head},
  author = {Rongjie Huang and Mingze Li and Dongchao Yang and Jiatong Shi and Xuankai Chang and Zhenhui Ye and Yuning Wu and Zhiqing Hong and Jiawei Huang and Jinglin Liu and Yi Ren and Zhou Zhao and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2304.12995},
  year   = {2023}
}