MotionFix: 文本驱动的三维人体运动编辑
计算机视觉与模式识别
2024-11-26 v3 图形学
摘要
本文聚焦于三维运动编辑。给定一个三维人体运动和所需修改的文本描述,我们的目标是生成如文本所描述的编辑后运动。关键挑战包括训练数据的稀缺以及需要设计能够准确编辑源运动的模型。在本文中,我们解决了这两个挑战。我们提出了一种半自动收集三元组数据集的方法,三元组包括(i)源运动、(ii)目标运动和(iii)编辑文本,引入了新的MotionFix数据集。访问这些数据使我们能够训练一个条件扩散模型TMED,该模型以源运动和编辑文本作为输入。我们开发了多个基线来评估我们的模型,将其与仅基于文本-运动对数据集训练的模型进行比较,并展示了基于三元组训练的模型的优越性能。我们还引入了新的基于检索的运动编辑评估指标,在MotionFix评估集上建立了基准。我们的结果令人鼓舞,为细粒度运动生成的后续研究铺平了道路。代码、模型和数据可在 https://motionfix.is.tue.mpg.de/ 获取。
引用
@article{arxiv.2408.00712,
title = {MotionFix: Text-Driven 3D Human Motion Editing},
author = {Nikos Athanasiou and Alpár Cseke and Markos Diomataris and Michael J. Black and Gül Varol},
journal= {arXiv preprint arXiv:2408.00712},
year = {2024}
}
备注
SIGGRAPH Asia 2024 Camera Ready, Project page: https://motionfix.is.tue.mpg.de