中文

借助视觉增强标题提升音频生成

声音 2025-01-03 v4 多媒体 音频与语音处理

摘要

生成模型在音频生成任务中取得了显著成果。然而,现有模型在处理复杂且细节丰富的提示时表现下降。我们假设这源于训练数据的简单性和稀缺性。本工作旨在创建大规模带丰富标题的音频数据集以改进音频生成模型。我们首先开发了一个自动化管道,通过将预测的视觉标题、音频标题和标记标签转化为综合描述,使用大型语言模型(LLM)生成详细标题。最终构建的数据集Sound-VECaps包含166万组高质量音频-标题对,涵盖音频事件顺序、发生地点和环境信息等丰富细节。我们随后表明,使用Sound-VECaps训练文本到音频生成模型可显著提升在复杂提示上的性能。此外,我们在多个下游音频语言任务上进行了模型消融研究,展示了Sound-VECaps在推动音频文本表征学习方面的潜力。我们的数据集和模型可在https://yyua8222.github.io/Sound-VECaps-demo/上线。

关键词

引用

@article{arxiv.2407.04416,
  title  = {Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions},
  author = {Yi Yuan and Dongya Jia and Xiaobin Zhuang and Yuanzhe Chen and Zhengxi Liu and Zhuo Chen and Yuping Wang and Yuxuan Wang and Xubo Liu and Xiyuan Kang and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2407.04416},
  year   = {2025}
}

备注

5 pages with 1 appendix, accepted by ICASSP 2025