基于负向条件潜在扩散模型提升舞蹈到音乐生成
声音
2025-03-31 v1 计算机视觉与模式识别
音频与语音处理
摘要
条件扩散模型因其卓越的跨模态合成结果而日益受到关注,其中通过训练具有跨注意力机制的时间条件U-Net,可实现强大的条件输入与生成输出之间的对齐。本文聚焦于生成与给定舞蹈视频节奏视觉线索同步的音乐。考虑到双向引导对训练扩散模型更有利,我们提出通过采用正向节奏信息和负向信息(PN-Diffusion)作为条件来增强生成音乐质量及其与舞蹈视频的同步性,其中设计了双扩散和逆过程。具体而言,为训练顺序多模态U-Net结构,PN-Diffusion包括针对正向条件的噪声预测目标以及针对负向条件的额外噪声预测目标。为准确定义和选择正负条件,我们巧妙地利用舞蹈视频中的时间关联性,通过正向和逆向播放捕获正负节奏线索。在舞蹈-音乐节拍对齐和生成音乐质量方面的主观和客观评估中,实验结果表明,我们的方法在AIST++和TikTok 舞蹈视频数据集上优于最先进的舞蹈到音乐生成模型。
引用
@article{arxiv.2503.22138,
title = {Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model},
author = {Changchang Sun and Gaowen Liu and Charles Fleming and Yan Yan},
journal= {arXiv preprint arXiv:2503.22138},
year = {2025}
}