从自由形式文本提示统一合成构成式语音与声音
声音
2026-05-28 v1 人工智能
多媒体
摘要
音频生成取得了显著进展,但实现语音与声音自然组合的统一音频合成仍是一个挑战。当前方法要么依赖离散管道,无法捕捉细粒度互动,要么要求结构化输入和外部文本重写,限制了自由形式文本提示的灵活性。本文引入新任务:从自由形式文本提示生成统一音频(Free-Form-Text-Prompt-to-Unified-Audio generation),旨在直接合成包含语音、声音及其组合的统一音频。为此,我们提出PlanAudio框架,基于自动回归大语言模型构建统一框架。首先,它通过利用内在的LLM推理能力,简化了模型架构,取代了传统文本编码器。其次,它引入语义潜在链式思维(semantic latent chain-of-thought)机制,这是一种隐式规划机制,桥接了高层语义理解与低层声学合成。进一步,我们创建了PlanAudio-Bench,用于评估组合音频场景的专用基准。我们在语音、声音及其组合场景中进行评估。结果表明,PlanAudio在现有管道方法和统一基线上普遍表现优于后者,同时在针对单一场景设计的模型中保持竞争力。我们的分析进一步揭示了语义潜在链式思维优于其他链式思维机制的优势,并强调了持续多场景训练课程的重要性。
引用
@article{arxiv.2605.28063,
title = {Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts},
author = {Yuyue Wang and Xihua Wang and Xin Cheng and Yijing Chen and Ruihua Song},
journal= {arXiv preprint arXiv:2605.28063},
year = {2026}
}