FreGrad:轻量级且快速的频率感知扩散声码器
音频与语音处理
2024-01-19 v1 人工智能
信号处理
摘要
本文的目标是利用一种名为 FreGrad 的轻量级且快速的基于扩散的声码器生成逼真的音频。我们的框架包含以下三个关键组件:(1) 我们采用离散小波变换将复杂的波形分解为子带小波,这有助于 FreGrad 在简单简洁的特征空间上运行;(2) 我们设计了一种频率感知空洞卷积,提升了频率感知能力,从而生成具有准确频率信息的语音;(3) 我们引入了一系列技巧以提升所提出模型的生成质量。在我们的实验中,与基线相比,FreGrad 的训练时间快了 3.7 倍,推理速度快了 2.2 倍,同时将模型大小减少了 0.6 倍(仅 1.78M 参数),且未牺牲输出质量。音频样本可在以下网址获取:https://mm.kaist.ac.kr/projects/FreGrad。
引用
@article{arxiv.2401.10032,
title = {FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder},
author = {Tan Dat Nguyen and Ji-Hoon Kim and Youngjoon Jang and Jaehun Kim and Joon Son Chung},
journal= {arXiv preprint arXiv:2401.10032},
year = {2024}
}
备注
Accepted to ICASSP 2024