中文

Mel-Refine:精炼音频生成中Mel谱图的插件方法

声音 2024-12-12 v1 多媒体 音频与语音处理

摘要

文本到音频(TTA)模型能够从文本提示生成多样化音频。然而,大多数主流TTA模型主要依赖Mel谱图,仍面临生成富有内容音频的挑战。Mel谱图中所需的细节和纹理常常超出模型容量,导致输出模糊或缺乏一致性。本文首先研究了U-Net在Mel谱图生成中的关键作用。我们的分析表明,在U-Net结构中,跳接连接和主干中的高频分量影响纹理和细节,而主干中的低频分量对扩散去噪过程至关重要。我们进一步提出一种“Mel-Refine”方法,通过在推理过程中调整不同组件的权重来增强Mel谱图的纹理和细节。该方法无需额外训练或微调,完全兼容任何基于扩散的TTA架构。实验结果表明,我们的方法将最新TTA模型Tango2的性能指标提升了25%,显示出其有效性。

关键词

引用

@article{arxiv.2412.08577,
  title  = {Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation},
  author = {Hongming Guo and Ruibo Fu and Yizhong Geng and Shuai Liu and Shuchen Shi and Tao Wang and Chunyu Qiang and Chenxing Li and Ya Li and Zhengqi Wen and Yukun Liu and Xuefei Liu},
  journal= {arXiv preprint arXiv:2412.08577},
  year   = {2024}
}