中文

AudioComposer:基于自然语言描述实现细粒度音频生成

音频与语音处理 2025-04-01 v2 声音

摘要

当前的文本到音频(Text-to-audio, TTA)模型主要使用粗糙的文本描述作为输入来生成音频,这限制了模型对内容和风格进行细粒度控制的能力。 some 研究尝试通过融合额外的帧级条件或控制网络来提升细粒度控制。然而,这通常导致系统设计复杂且困难,因为需要参考帧级条件。为此,我们提出AudioComposer,一种新型的 TTA 生成框架,仅依赖自然语言描述(Natural Language Descriptions, NLDs)即可提供内容规格和风格控制信息。为进一步提升音频生成建模,我们采用基于流的扩散转换器,通过跨注意力机制将文本描述有效地融入音频生成过程,这不仅能同时考虑文本输入中的内容和风格信息,还能与其他架构相比加速生成。此外,我们提出一种新型且全面的自动数据模拟管道,用于构建具有细粒度文本描述的数据,显著缓解了该领域数据稀缺的问题。实验表明,我们的框架仅使用 NLDs 作为输入即可实现对内容规格和风格控制,生成的音频质量和可控性优于最先进的 TTA 模型,即使模型规模较小。

关键词

引用

@article{arxiv.2409.12560,
  title  = {AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions},
  author = {Yuanyuan Wang and Hangting Chen and Dongchao Yang and Zhiyong Wu and Xixin Wu},
  journal= {arXiv preprint arXiv:2409.12560},
  year   = {2025}
}

备注

Accepted by ICASSP 2025