中文

OpenHumanVid:面向提升人类中心视频生成的大规模高质量数据集

计算机视觉与模式识别 2025-01-07 v3

摘要

近期的视觉生成技术进展显著提升了视频数据集的规模和可获取性,这对于训练有效的视频生成模型至关重要。然而,缺乏高质量的人类中心视频数据集,仍是该领域面临的重大挑战。为弥合这一差距,我们引入了 OpenHumanVid,这是一个大规模且高质量的人类中心视频数据集,其特征为具有精准且详尽的标题,涵盖人类外观与动作状态,并附带人类运动条件,包括骨架序列和语音音频。为验证该数据集及相关训练策略的有效性,我们提出了对现有经典扩散变换器架构的扩展,并对模型在所提数据集上进行进一步预训练。我们的发现得出两个关键见解:首先,融合大规模高质量数据集在生成人类视频时显著提升评估指标,同时保持在一般视频生成任务中的性能;其次,文本与人类外观、人类运动及面部运动的有效对齐,对于生成高质量视频输出至关重要。基于这些见解及相应方法ology,经由该数据集训练得到的简单扩展网络在人类中心视频生成方面表现明显提升。项目页面 https://fudan-generative-vision.github.io/OpenHumanVid

关键词

引用

@article{arxiv.2412.00115,
  title  = {OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation},
  author = {Hui Li and Mingwang Xu and Yun Zhan and Shan Mu and Jiaye Li and Kaihui Cheng and Yuxuan Chen and Tan Chen and Mao Ye and Jingdong Wang and Siyu Zhu},
  journal= {arXiv preprint arXiv:2412.00115},
  year   = {2025}
}

备注

11 pages, 8 figures, 5 tables