SRC-gAudio:基于抽样率控制的音频生成
声音
2024-10-10 v1 音频与语音处理
摘要
我们提出了 SRC-gAudio,一种新的音频生成模型,旨在支持单一模型架构内跨多种抽样率的文本到音频生成。SRC-gAudio 将抽样率作为生成条件的一部分,以引导基于扩散的音频生成过程。我们的模型实现了单一统一模型在受控抽样率下的音频生成。此外,我们探讨了大规模低抽样率数据在提升高抽样率音频生成质量方面的潜在益处。通过大量实验,我们证明 SRC-gAudio 能有效地在受控抽样率下生成音频。此外,我们的结果表明,在低抽样率数据上进行预训练可显著提高音频质量。
引用
@article{arxiv.2410.06544,
title = {SRC-gAudio: Sampling-Rate-Controlled Audio Generation},
author = {Chenxing Li and Manjie Xu and Dong Yu},
journal= {arXiv preprint arXiv:2410.06544},
year = {2024}
}
备注
Accepted by APSIPA2024