中文

Auffusion:利用扩散模型和大语言模型的力量进行文本到音频生成

声音 2024-01-03 v1 人工智能 计算与语言 音频与语音处理

摘要

扩散模型和大语言模型(LLMs)的最新进展极大地推动了AIGC领域的发展。文本到音频(TTA)是一种新兴的AIGC应用,旨在从自然语言提示生成音频,正吸引越来越多的关注。然而,现有的TTA研究常常在生成质量和文本-音频对齐方面遇到困难,尤其是对于复杂的文本输入。受最先进的文本到图像(T2I)扩散模型的启发,我们引入了Auffusion,这是一个将T2I模型框架适配到TTA任务的系统,通过有效利用其固有的生成优势和精确的跨模态对齐。我们的客观和主观评估表明,Auffusion在使用有限数据和计算资源的情况下超越了之前的TTA方法。此外,先前在T2I中的研究认识到编码器选择对跨模态对齐(如细粒度细节和对象绑定)的显著影响,而先前的TTA工作中缺乏类似的评估。通过全面的消融研究和创新的交叉注意力图可视化,我们提供了对TTA中文本-音频对齐的深入评估。我们的发现揭示了Auffusion在生成准确匹配文本描述的音频方面的卓越能力,这在音频风格迁移、修复和其他操作等相关任务中得到了进一步证明。我们的实现和演示可在https://auffusion.github. io获取。

关键词

引用

@article{arxiv.2401.01044,
  title  = {Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation},
  author = {Jinlong Xue and Yayue Deng and Yingming Gao and Ya Li},
  journal= {arXiv preprint arXiv:2401.01044},
  year   = {2024}
}

备注

Demo and implementation at https://auffusion.github.io