平衡信噪比感知蒸馏用于引导式文本到音频生成
声音
2023-12-27 v1 音频与语音处理
摘要
扩散模型在文本到音频生成任务中已显示出有希望的结果。然而,它们的实际可用性受到采样速度慢的阻碍,限制了它们在高吞吐量场景中的适用性。为了应对这一挑战,渐进式蒸馏方法已有效地产生了更紧凑和高效的模型。然而,这些方法在高噪声和低噪声水平下遇到权重不平衡的问题,可能影响生成样本的质量。在本文中,我们提出将渐进式蒸馏方法适应于文本到音频生成任务,并引入平衡信噪比感知(BSA)方法,一种用于扩散蒸馏的增强损失加权机制。BSA方法采用平衡的方法来加权高噪声和低噪声水平的损失。我们在AudioCaps数据集上评估了我们提出的方法,并报告了实验结果表明,在相同采样步数下,与之前的蒸馏方法相比,在反向扩散过程中具有更优的性能。此外,BSA方法允许将采样步数从200大幅减少到25,与原始教师模型相比,性能下降最小。
引用
@article{arxiv.2312.15628,
title = {Balanced SNR-Aware Distillation for Guided Text-to-Audio Generation},
author = {Bingzhi Liu and Yin Cao and Haohe Liu and Yi Zhou},
journal= {arXiv preprint arXiv:2312.15628},
year = {2023}
}
备注
5 pages