中文

WavCraft:基于大语言模型的音频编辑与生成

音频与语音处理 2024-05-13 v3

摘要

我们介绍 WavCraft,一个集合系统,利用大语言模型(LLM)将多样化的任务特定模型连接起来,用于音频内容的创建和编辑。具体而言,WavCraft 描述原始音频材料的内在语言内容,并在音频描述和用户请求的条件下触发 LLM。WavCraft 利用 LLM 的上下文学习能力,将用户指令分解为多个任务,并通过特定模块协同处理每个任务。通过任务分解以及一组任务特定模型,WavCraft 按照输入指令创建或编辑音频内容,提供更多细节和理由,促进用户控制。此外,WavCraft 能够通过对话式交互与用户协作,甚至在没有明确用户命令的情况下生成音频内容。实验表明,WavCraft 的性能优于现有方法,尤其在调整音频片段的局部区域方面效果更佳。此外,WavCraft 能够在输入录音的基础上遵循复杂指令编辑和创建音频内容,促进更广泛的应用中的音频制作者。我们的实现和演示可在 https://github.com/JinhuaLiang/WavCraft 查看。

关键词

引用

@article{arxiv.2403.09527,
  title  = {WavCraft: Audio Editing and Generation with Large Language Models},
  author = {Jinhua Liang and Huan Zhang and Haohe Liu and Yin Cao and Qiuqiang Kong and Xubo Liu and Wenwu Wang and Mark D. Plumbley and Huy Phan and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2403.09527},
  year   = {2024}
}