中文

PicoAudio2:基于自然语言描述的可控文本到音频生成

声音 2025-10-14 v2 音频与语音处理

摘要

虽然近期在可控文本到音频(TTA)生成方面的工作已通过时间戳条件化实现细粒度控制,但其应用范围仍受限于音频质量和输入格式。这些模型往往因仅依赖合成数据而在真实数据集上表现出差异的音频质量。此外,一些模型受限于声音事件的封闭词汇表,无法控制开放式、自由文本查询的音频生成。本文介绍 PicoAudio2,一个推进时序可控 TTA 的框架,以缓解这些数据和架构限制。具体而言,我们使用 grounding 模型为真实音频-文本数据集注释事件时间戳,以构建时序强实数据,此外还包括来自现有工作的仿真数据。该模型在真实数据和仿真数据的组合上进行训练。此外,我们提出了增强型架构,将时间戳矩阵中的细粒度信息与粗粒度自由文本输入相集成。实验表明,PicoAudio2 在时序可控性和音频质量方面表现优异。

关键词

引用

@article{arxiv.2509.00683,
  title  = {PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description},
  author = {Zihao Zheng and Zeyu Xie and Xuenan Xu and Wen Wu and Chao Zhang and Mengyue Wu},
  journal= {arXiv preprint arXiv:2509.00683},
  year   = {2025}
}

备注

Demo page: https://HiRookie9.github.io/PicoAudio2-Page