中文

UniMuMo:统一的文本、音乐与动作生成

声音 2024-10-08 v1 计算机视觉与模式识别 图形学 机器学习 多媒体 音频与语音处理

摘要

我们提出UniMuMo,一个能够以任意文本、音乐和动作数据作为输入条件,生成跨三种模态输出的统一多模态模型。为解决缺乏时间同步数据的难题,我们基于节奏模式将无配对的音乐和动作数据对齐,以利用现有的大规模仅音乐和仅动作数据集。通过将音乐、动作和文本转换为基于标记的表示,本模型通过统一的编码器-解码器Transformer架构桥接这些模态。为支持单个框架内的多个生成任务,我们引入了若干架构改进。我们提出以音乐码本编码动作,将动作映射到与音乐相同的特征空间。我们引入音乐-动作并行生成方案,将所有音乐和动作生成任务统一为单个Transformer解码器架构,单一训练任务为音乐-动作联合生成。此外,模型通过微调现有的预训练单模态模型实现,显著降低了计算需求。广泛的实验表明,UniMuMo在音乐、动作和文本模态的所有单向生成基准上均取得竞争成绩。定量结果已在\href{https://hanyangclarence.github.io/unimumo_demo/}{项目页面}中呈现。

关键词

引用

@article{arxiv.2410.04534,
  title  = {UniMuMo: Unified Text, Music and Motion Generation},
  author = {Han Yang and Kun Su and Yutong Zhang and Jiaben Chen and Kaizhi Qian and Gaowen Liu and Chuang Gan},
  journal= {arXiv preprint arXiv:2410.04534},
  year   = {2024}
}