AudioGen:文本引导的音频生成
声音
2023-03-07 v2 计算与语言
机器学习
音频与语音处理
摘要
我们解决基于描述性文本字幕生成音频样本的问题。本文中,我们提出 AudioGen,一种以文本输入为条件生成音频样本的自回归生成模型。AudioGen 作用于学习到的离散音频表示。文本到音频生成任务带来多重挑战。由于音频在介质中传播的方式,区分“对象”可能是困难的任务(例如,分离同时说话的多人)。真实世界录音条件(例如,背景噪声、混响等)使问题进一步复杂。稀缺的文本标注构成另一限制,制约了模型扩展能力。最后,建模高保真音频需以高采样率编码音频,导致极长序列。为缓解上述挑战,我们提出一种混合不同音频样本的增强技术,驱动模型在内部学习分离多源。我们整理了包含不同类型音频与文本标注的 10 个数据集以应对文本-音频数据点的稀缺。为加速推理,我们探索多流建模的使用,在维持相似比特率与感知质量的同时允许使用更短序列。我们应用无分类器引导以改善对文本的遵循。与评估的基线相比,AudioGen 在客观与主观指标上均更优。最后,我们探索所提方法在条件与非条件下生成音频续写的能力。样本:https://felixkreuk.github.io/audiogen
引用
@article{arxiv.2209.15352,
title = {AudioGen: Textually Guided Audio Generation},
author = {Felix Kreuk and Gabriel Synnaeve and Adam Polyak and Uriel Singer and Alexandre Défossez and Jade Copet and Devi Parikh and Yaniv Taigman and Yossi Adi},
journal= {arXiv preprint arXiv:2209.15352},
year = {2023}
}
备注
Accepted to ICLR 2023