中文

Fleximo:面向灵活文本到人类运动视频生成

计算机视觉与模式识别 2024-12-02 v1 机器学习

摘要

当前用于生成人类运动视频的方法依赖从参考视频中提取姿态序列,这限制了灵活性和控制能力。此外,由于姿态检测技术的局限性,提取的姿态序列有时可能不准确,导致视频输出质量较低。我们提出一种新任务,即仅从参考图像和自然语言生成人类运动视频。这种方法更灵活,更易于使用,因为文本比所需的指导视频更易于获取。然而,要实现此任务的端到端模型训练,需要数百万高质量的文本和人类运动视频配对,这在实际中难以获得。为此,我们提出一种名为 Fleximo 的新框架,该框架利用大规模预训练文本到 3D 运动模型。这一方法并不直接,因为文本生成的骨架可能不一致地匹配参考图像的尺度,并且可能缺乏细节。为克服这些挑战,我们引入基于锚点点的缩放方法,并设计骨架适配器以填补细节缺失并桥接文本到运动与运动到视频生成之间的差距。我们还提出一种视频细化过程进一步提升视频质量。大语言模型 (LLM) 用于将自然语言分解为离散运动序列,实现任意所需长度的运动视频生成。为评估 Fleximo 的性能,我们引入了新的基准测试 MotionBench,其中包含 400 个视频,涵盖 20 个身份和 20 种运动。我们还提出了新的指标 MotionScore,用于评估运动跟随精确度。定性和定量结果均表明,我们的方法在现有基于文本条件图像到视频生成方法中表现优异。所有代码和模型权重将公开释放。

关键词

引用

@article{arxiv.2411.19459,
  title  = {Fleximo: Towards Flexible Text-to-Human Motion Video Generation},
  author = {Yuhang Zhang and Yuan Zhou and Zeyu Liu and Yuxuan Cai and Qiuyue Wang and Aidong Men and Huan Yang},
  journal= {arXiv preprint arXiv:2411.19459},
  year   = {2024}
}