基于扩散的文本到音乐生成:结合全局和局部文本条件的研究
音频与语音处理
2025-01-28 v2 声音
摘要
基于扩散的文本到音乐(TTM)模型生成对应文本描述的音乐。通常,基于 UNet 的扩散模型条件化于来自预训练大语言模型或跨模态音频语言表示模型生成的文本嵌入。本文提出一种基于扩散的 TTM 模型,UNet 通过跨注意力条件化于单模态语言模型(如 T5),通过特征线性调制(FiLM)条件化于跨模态音频语言表示模型(如 CLAP)。扩散模型训练以利用来自 T5 的局部文本表示和来自 CLAP 的全局表示。此外,我们提出的修改方法通过池化机制从 T5 中提取全局和局部表示,称为均值池化和自注意力池化。该方法缓解了需要额外编码器(如 CLAP)提取全局表示的需求,从而减少了模型参数。我们的结果表明,将 CLAP 全局嵌入纳入 T5 局部嵌入可提高文本遵循度(KL=1.47),而仅依赖 T5 局部嵌入的基线模型文本遵循度为 KL=1.54。或者,通过提出的均值池化方法直接从 T5 局部嵌入中提取全局文本嵌入,可获得更优的生成质量(FAD=1.89),虽在文本遵循度上略逊于同时依赖 CLAP 和 T5 文本嵌入的模型(FAD=1.94,KL=1.47)。我们提出的解决方案不仅高效,而且在所需参数数量上也紧凑。
引用
@article{arxiv.2501.14680,
title = {Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning},
author = {Jisi Zhang and Pablo Peso Parada and Md Asif Jalal and Karthikeyan Saravanan},
journal= {arXiv preprint arXiv:2501.14680},
year = {2025}
}
备注
Accepted at ICASSP 2025