LiteFocus:长音频合成中扩散推理的加速方法
声音
2024-07-16 v1 人工智能
音频与语音处理
摘要
潜在扩散模型在音频生成方面展现出前所未有的潜力,相较于传统方法取得了显著进展。然而,尽管在短音频片段上表现优异,但当扩展到长音频序列时,仍面临挑战。这些挑战源于模型的自注意力机制以及主要在10秒短片段上进行训练,使得在未经适应的情况下延伸至长音频变得复杂。针对上述问题,我们提出一种新方法,LiteFocus,通过增强现有音频潜在扩散模型在长音频合成中的推理性能。在观察自注意力模式后,我们采用两种稀疏形式进行注意力计算,分别称为同频聚焦和跨频补偿,这既限制了同频约束下的注意力计算,又通过跨频补强提升了音频质量。LiteFocus 在基于扩散的 TTA 模型中,合成 80 秒音频片段的推理时间缩短了 1.99 倍,同时获得了更好的音频质量。
引用
@article{arxiv.2407.10468,
title = {LiteFocus: Accelerated Diffusion Inference for Long Audio Synthesis},
author = {Zhenxiong Tan and Xinyin Ma and Gongfan Fang and Xinchao Wang},
journal= {arXiv preprint arXiv:2407.10468},
year = {2024}
}
备注
Interspeech 2024; Code: https://github.com/Yuanshi9815/LiteFocus