中文

面向文本到音频模型的合成标题

计算与语言 2024-07-10 v2 机器学习 声音 音频与语音处理

摘要

获取高质量训练数据,尤其是标题,对文本到音频模型构成挑战。虽然先前方法利用仅文本的语言模型来扩充和改进标题,但这些方法受限于规模和音频与标题之间的连贯性。在本工作中,我们提出一种音频标题管道,使用仅音频的语言模型对音频进行规模化合成准确且多样化的标题。我们利用该管道为 AudioSet 生成合成标题数据集,命名为 \texttt{AF-AudioSet},随后评估在这些合成标题上预训练文本到音频模型的益处。通过在 AudioCaps 和 MusicCaps 上的系统评估,我们发现利用该管道和合成标题导致音频生成质量显著提升,实现了新的最先进水平。

关键词

引用

@article{arxiv.2406.15487,
  title  = {Improving Text-To-Audio Models with Synthetic Captions},
  author = {Zhifeng Kong and Sang-gil Lee and Deepanway Ghosal and Navonil Majumder and Ambuj Mehrish and Rafael Valle and Soujanya Poria and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2406.15487},
  year   = {2024}
}