面向开放域文本驱动的多人运动合成
计算机视觉与模式识别
2024-07-16 v2
摘要
这项工作旨在从文本描述中生成自然且多样化的多人群体运动。虽然单人文本到运动生成已被广泛研究,但从开放世界提示中合成超过一或两个主体的运动仍然具有挑战性,这主要是由于缺乏可用的数据集。在这项工作中,我们通过从大规模图像和视频数据集中估计姿态信息来整理人体姿态和运动数据集。我们的模型使用基于Transformer的扩散框架,可以容纳具有任意数量主体或帧的多个数据集。实验探索了多人静态姿态的生成和多人运动序列的生成。据我们所知,我们的方法是第一个从大量文本提示中生成具有高多样性和保真度的多主体运动序列的方法。
引用
@article{arxiv.2405.18483,
title = {Towards Open Domain Text-Driven Synthesis of Multi-Person Motions},
author = {Mengyi Shan and Lu Dong and Yutao Han and Yuan Yao and Tao Liu and Ifeoma Nwogu and Guo-Jun Qi and Mitch Hill},
journal= {arXiv preprint arXiv:2405.18483},
year = {2024}
}
备注
ECCV 2024. Project page: https://shanmy.github.io/Multi-Motion/