中文

面向丰富视频人体动作2D生成的探索

计算机视觉与模式识别 2025-06-18 v1

摘要

生成逼真且可控的人体动作,尤其是涉及丰富多角色互动的动作,仍然面临数据稀缺和建模人际动态复杂度两个显著挑战。为解决这些限制,我们首先引入了新的大型丰富视频人体动作2D数据集(Motion2D-Video-150K),包含15万个视频序列。Motion2D-Video-150K具有单角色和关键双角色互动动作在平衡分布,每种动作都配有详细的文本描述。基于此数据集,我们提出了一种新型扩散式丰富视频人体动作2D生成(RVHM2D)模型。RVHM2D包含增强的文本条件机制,可采用双文本编码器(CLIP-L/B)或T5-XXL,结合全局和局部特征。我们设计了两阶段训练策略:首先以标准扩散目标训练模型,然后利用基于FID的奖励进行强化学习微调,以进一步提升动作的真实性和文本对齐度。大量实验表明,RVHM2D在Motion2D-Video-150K基准上实现了领先性能,成功生成单角色和互动双角色场景。

关键词

引用

@article{arxiv.2506.14428,
  title  = {Toward Rich Video Human-Motion2D Generation},
  author = {Ruihao Xi and Xuekuan Wang and Yongcheng Li and Shuhua Li and Zichen Wang and Yiwei Wang and Feng Wei and Cairong Zhao},
  journal= {arXiv preprint arXiv:2506.14428},
  year   = {2025}
}