Audiobox:基于自然语言提示的统一音频生成
声音
2023-12-27 v1 机器学习
音频与语音处理
摘要
音频是我们生活中必不可少的一部分,但创建音频通常需要专业知识且耗时。过去一年,研究社区在通过采用更强大的生成模型和扩展数据来提升单一模态(语音、声音或音乐)的大规模音频生成模型性能方面取得了巨大进展。然而,这些模型在多个方面缺乏可控性:语音生成模型无法基于文本描述合成新颖的风格,并且在领域覆盖(如室外环境)方面受限;声音生成模型仅基于“一个人在说话”等描述提供粗粒度控制,并且只会生成含糊不清的人声。本文提出了Audiobox,一个基于流匹配的统一模型,能够生成多种音频模态。我们设计了基于描述和基于示例的提示来增强可控性,并统一语音和声音生成范式。我们允许在生成语音时独立控制转录、人声和其他音频风格。为了提高模型在有限标签下的泛化能力,我们采用自监督填充目标对大量未标记音频进行预训练。Audiobox在语音和声音生成方面设立了新的基准(零样本TTS在Librispeech上相似度0.745;文本到声音在AudioCaps上FAD 0.77),并解锁了生成具有新颖人声和声学风格的音频的新方法。我们进一步集成了Bespoke Solvers,与流匹配的默认ODE求解器相比,生成速度提高了25倍以上,且在多个任务上性能无损。我们的演示可在https://audiobox.metademolab.com/获取。
引用
@article{arxiv.2312.15821,
title = {Audiobox: Unified Audio Generation with Natural Language Prompts},
author = {Apoorv Vyas and Bowen Shi and Matthew Le and Andros Tjandra and Yi-Chiao Wu and Baishan Guo and Jiemin Zhang and Xinyue Zhang and Robert Adkins and William Ngan and Jeff Wang and Ivan Cruz and Bapi Akula and Akinniyi Akinyemi and Brian Ellis and Rashel Moritz and Yael Yungster and Alice Rakotoarison and Liang Tan and Chris Summers and Carleigh Wood and Joshua Lane and Mary Williamson and Wei-Ning Hsu},
journal= {arXiv preprint arXiv:2312.15821},
year = {2023}
}