基于编码器的文本反向映射的舞蹈到音乐生成
声音
2024-09-16 v2 多媒体
音频与语音处理
摘要
将音乐与舞蹈动作无缝集成对于传达舞蹈作品的艺术意图至关重要。这一对齐也显著提高了游戏体验和动画制作的沉浸质量。虽然当前方法在从文本描述生成高保真音乐方面取得了显著进展,但这些方法主要关注调制整体特征如风格和情感基调,往往忽略对时序节奏的细致管理,而这在为舞蹈创作音乐时至关重要,因为它精细地将音乐节拍与舞者动作对齐。为填补这一差距,我们提出一种基于编码器的文本反向映射技术,以增强文本到音乐模型的视觉控制,实现个性化音乐生成。具体而言,我们开发了双路径节奏-风格反向映射,有效地将舞蹈动作序列的节奏和风格集成到文本到音乐模型的文本空间中。与传统文本反向映射方法不同,后者直接更新文本嵌入来重建单个目标对象,而我们的做法利用独立的节奏和风格编码器获取两个伪词的文本嵌入,以适应不同节奏和风格。我们收集了一个名为In-the-wild Dance Videos(InDV)的新型数据集,并通过多个评估指标展示了我们方法在SOTA方法上的优势。此外,我们的方法能够适应节拍变化并有效集成到预训练模型内在的文本引导生成能力中。我们的源代码和演示视频可在\url{https://github.com/lsfhuihuiff/Dance-to-music_Siggraph_Asia_2024}获取。
引用
@article{arxiv.2401.17800,
title = {Dance-to-Music Generation with Encoder-based Textual Inversion},
author = {Sifei Li and Weiming Dong and Yuxin Zhang and Fan Tang and Chongyang Ma and Oliver Deussen and Tong-Yee Lee and Changsheng Xu},
journal= {arXiv preprint arXiv:2401.17800},
year = {2024}
}
备注
11 pages, 5 figures, SIGGRAPH ASIA 2024