RapVerse:从文本生成连贯的声音和全身运动
计算机视觉与模式识别
2025-12-16 v3 声音
音频与语音处理
摘要
在这项工作中,我们引入了一项具有挑战性的任务:直接从文本歌词输入同时生成3D整体身体运动和歌唱声音,超越了现有通常分别处理这两种模态的工作。为促进此任务,我们首先收集了RapVerse数据集,这是一个包含同步说唱声音、歌词和高质量3D整体身体网格的大型数据集。利用RapVerse数据集,我们研究了跨语言、音频和运动的自回归多模态变换器的扩展程度如何增强声音和全身人体运动的连贯和真实生成。为统一模态,我们使用向量量化变分自编码器将全身运动序列编码为离散运动令牌,并利用声音到单元模型获得保留内容、韵律信息和歌手身份的量化音频令牌。通过以统一方式联合对这些三种模态进行变换器建模,我们的框架确保了声音和人体运动的无缝和真实融合。大量实验表明,我们的统一生成框架不仅能够直接从文本输入生成连贯且真实的说唱声音和人体运动,而且与专门单模态生成系统的性能相媲美,为联合声音-运动生成设立了新基准。
引用
@article{arxiv.2405.20336,
title = {RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text},
author = {Jiaben Chen and Xin Yan and Yihang Chen and Siyuan Cen and Zixin Wang and Qinwei Ma and Haoyu Zhen and Kaizhi Qian and Lie Lu and Chuang Gan},
journal= {arXiv preprint arXiv:2405.20336},
year = {2025}
}
备注
ICCV 2025, Project website: https://jiabenchen.github.io/RapVerse/