DreamAudio:基于扩散模型的定制化文本到音频生成
声音
2026-04-28 v3 人工智能
音频与语音处理
摘要
随着大规模扩散式和语言模型驱动的生成模型的发展,文本到音频生成取得了显著进展。尽管生成了高质量的输出,但现有的文本到音频模型主要旨在生成语义上一致的声音,且不足以控制特定声音的细粒度声学特征。因此,对于需要特定声音内容的用户,可能难以生成所需的音频片段。本文提出了用于定制化文本到音频生成(CTTA)的 DreamAudio。具体而言,我们引入了一种新框架,旨在使模型能够从用户提供的参考概念中识别听觉信息,以实现音频生成。给定包含个性化音频事件的少量参考音频样本,我们的系统可以生成包含这些特定事件的新音频样本。此外,开发了两种数据集用于训练和测试所提出的系统。实验表明,DreamAudio 生成的音频样本在定制化音频特征上高度一致,并能良好地对齐输入文本提示此外,DreamAudio 在通用文本到音频任务中也表现出色。我们还提供了一个包含来自实际 CTTA 案例中音频事件的人类参与数据集,作为定制化生成任务的基准。
引用
@article{arxiv.2509.06027,
title = {DreamAudio: Customized Text-to-Audio Generation with Diffusion Models},
author = {Yi Yuan and Xubo Liu and Haohe Liu and Xiyuan Kang and Zhuo Chen and Yuxuan Wang and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2509.06027},
year = {2026}
}
备注
Lastest arxiv version. Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing. Demos are available at https://yyua8222.github.io/DreamAudio_demopage/