中文

EgoVid-5M:用于第一人称视频生成的大规模视频-动作数据集

计算机视觉与模式识别 2024-11-14 v1

摘要

视频生成已成为利用视觉数据复制真实世界环境的世界模拟的有前景工具。在此背景下,以人类视角为中心的第一人称视频生成在增强虚拟现实、增强现实和游戏应用方面具有巨大潜力。然而,由于第一人称视角的动态特性、动作的复杂多样性以及所遇到场景的复杂多变性,第一人称视频的生成面临巨大挑战。现有数据集不足以有效应对这些挑战。为弥补这一差距,我们提出了 EgoVid-5M,这是第一个专门为第一人称视频生成而精心策划的高质量数据集。EgoVid-5M 包含 500 万个第一人称视频片段,并丰富了详细的动作标注,包括细粒度运动学控制和高层文本描述。为确保数据集的完整性和可用性,我们实施了一个复杂的数据清洗流程,旨在保持第一人称条件下的帧一致性、动作连贯性和运动平滑性。此外,我们引入了 EgoDreamer,它能够同时由动作描述和运动控制信号驱动生成第一人称视频。EgoVid-5M 数据集、相关的动作标注以及所有数据清洗元数据将被发布,以推动第一人称视频生成的研究。

关键词

引用

@article{arxiv.2411.08380,
  title  = {EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation},
  author = {Xiaofeng Wang and Kang Zhao and Feng Liu and Jiayu Wang and Guosheng Zhao and Xiaoyi Bao and Zheng Zhu and Yingya Zhang and Xingang Wang},
  journal= {arXiv preprint arXiv:2411.08380},
  year   = {2024}
}

备注

Project Page: https://egovid.github.io/