WavJourney:基于大语言模型的组合式音频创作
声音
2023-11-28 v2 人工智能
多媒体
音频与语音处理
摘要
尽管音频生成模型取得了突破,其能力常受限于特定领域条件,如语音转写和音频字幕。然而,真实世界的音频创作旨在生成包含语音、音乐和音效等多种元素且条件可控的和谐音频,现有音频生成系统难以应对。我们提出WavJourney,一种利用大语言模型(LLMs)连接各类音频模型以进行音频创作的新型框架。WavJourney允许用户仅通过文本描述即可创作具有多样音频元素的叙事音频内容。具体而言,给定文本指令后,WavJourney首先提示LLMs生成音频脚本,作为音频元素的结构化语义表示。该音频脚本随后被转换为计算机程序,其中每一行调用一个任务特定的音频生成模型或计算操作函数。该程序被执行以获得组合式且可解释的音频创作方案。实验结果表明,WavJourney能够合成与文本描述的语义、空间和时间条件对齐的真实音频,在文本到音频生成基准上取得最先进结果。此外,我们引入了一个新的多类型故事基准。主观评估展示了WavJourney从文本打造引人入胜的叙事音频内容的潜力。我们进一步证明WavJourney可在多轮对话中促进人机协同创作。为推进未来研究,代码与合成音频发布于:https://audio-agi.github.io/WavJourney_demopage/。
引用
@article{arxiv.2307.14335,
title = {WavJourney: Compositional Audio Creation with Large Language Models},
author = {Xubo Liu and Zhongkai Zhu and Haohe Liu and Yi Yuan and Meng Cui and Qiushi Huang and Jinhua Liang and Yin Cao and Qiuqiang Kong and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2307.14335},
year = {2023}
}
备注
GitHub: https://github.com/Audio-AGI/WavJourney