中文

OpenS2V-Nexus:面向主体到视频生成的细粒度基准与百万规模数据集

计算机视觉与模式识别 2025-06-04 v4 人工智能

摘要

主体到视频(S2V)生成旨在创建忠实融入参考内容的视频,为视频制作提供了更强的灵活性。为了建立 S2V 生成的基础设施,我们提出了 OpenS2V-Nexus,包含(i)一个细粒度基准 OpenS2V-Eval,以及(ii)一个百万规模数据集 OpenS2V-5M。与继承自 VBench 的现有 S2V 基准侧重于生成视频的全局和粗粒度评估不同,OpenS2V-Eval 专注于模型生成具有自然主体外观和身份保真度的主体一致性视频的能力。为此,OpenS2V-Eval 从 S2V 的七个主要类别中引入了 180 个提示词,其中结合了真实和合成的测试数据。此外,为了准确将人类偏好与 S2V 基准对齐,我们提出了三个自动评估指标:NexusScore、NaturalScore 和 GmeScore,分别用于量化生成视频中的主体一致性、自然度和文本相关性。在此基础上,我们对 18 个具有代表性的 S2V 模型进行了全面评估,突出了它们在不同内容上的优势和劣势。此外,我们创建了首个开源的大规模 S2V 生成数据集 OpenS2V-5M,由五百万个高质量的 720P 主体-文本-视频三元组组成。具体而言,我们通过(1)跨视频关联分割主体并构建配对信息,以及(2)在原始帧上提示 GPT-Image-1 合成多视角表示,确保了数据集中主体信息的多样性。通过 OpenS2V-Nexus,我们提供了稳健的基础设施以加速未来的 S2V 生成研究。

关键词

引用

@article{arxiv.2505.20292,
  title  = {OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation},
  author = {Shenghai Yuan and Xianyi He and Yufan Deng and Yang Ye and Jinfa Huang and Bin Lin and Jiebo Luo and Li Yuan},
  journal= {arXiv preprint arXiv:2505.20292},
  year   = {2025}
}

备注

Code and Dataset: https://github.com/PKU-YuanGroup/OpenS2V-Nexus