中文

FreeAudio:面向可控长文本到音频生成的无训练时序规划

声音 2025-09-19 v2 人工智能 多媒体 音频与语音处理

摘要

文本到音频(T2A)生成因生成模型的最新进展而取得了令人鼓舞的成果。然而,由于 Temporally 对齐的音频文本对数量和质量的限制,现有T2A方法难以处理包含精确时序控制的复杂文本提示,例如“在2.4s至5.2s之间啼鸦”。近期研究探索了数据增强技术或将时序条件作为模型输入引入,以实现对10秒时序条件T2A生成的支持,但其合成质量仍受限。本文提出一种新颖的无训练时序控制T2A框架——FreeAudio,首次实现时序控制的长文本T2A生成,例如“在2.4s至5.2s啼鸦,在0s至24s嗉鸣”。具体而言,我们首先基于输入文本和时序提示运用大语言模型规划非重叠时序窗口,并对每个窗口进行精炼的自然语言描述重新标注。随后我们引入:1)解耦与聚合注意力控制以实现精确时序控制;2)语境潜在组成以实现局部平滑性和参考引导以实现全局一致性。广泛实验表明:1)FreeAudio在无训练方法中实现了时序条件T2A合成质量的SOTA,且与领先的有训练方法相当;2)FreeAudio在质量上与基于训练的Stable Audio相当,为时序控制的长文本T2A合成铺平了道路。演示样本可在:https://freeaudio.github.io/FreeAudio/ 查看。

关键词

引用

@article{arxiv.2507.08557,
  title  = {FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation},
  author = {Yuxuan Jiang and Zehua Chen and Zeqian Ju and Chang Li and Weibei Dou and Jun Zhu},
  journal= {arXiv preprint arXiv:2507.08557},
  year   = {2025}
}

备注

Accepted at ACM MM 2025