中文

ConsistencyTTA:基于一致性蒸馏加速扩散式文本到音频生成

声音 2024-06-25 v3 机器学习 多媒体 音频与语音处理

摘要

扩散模型在文本到音频(TTA)生成中发挥着重要作用。遗憾的是,由于其每次生成对底层去噪网络的过多查询次数,它们存在推理缓慢的问题。为解决该瓶颈,我们引入ConsistencyTTA,一种仅需单次非自回归网络查询的框架,从而将TTA加速数百倍。我们通过提出“CFG感知潜空间一致性模型”实现此点,该模型将一致性生成适配至潜空间并将无分类器引导(CFG)纳入模型训练。此外,与扩散模型不同,ConsistencyTTA可利用音频空间文本感知指标(如CLAP分数)进行闭环微调,以进一步增强生成。我们在AudioCaps数据集上的客观与主观评测表明,相较于基于扩散的对应方法,ConsistencyTTA在保持生成质量与多样性的同时将推理计算降低400倍。

关键词

引用

@article{arxiv.2309.10740,
  title  = {ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation},
  author = {Yatong Bai and Trung Dang and Dung Tran and Kazuhito Koishida and Somayeh Sojoudi},
  journal= {arXiv preprint arXiv:2309.10740},
  year   = {2024}
}