SceneScribe-1M:具备详尽几何与语义标注的大规模视频数据集
计算机视觉与模式识别
2026-04-28 v2
摘要
3D 几何感知与视频合成的融合正在创造对大规模视频数据的 unprecedented 需求,这些视频数据富含语义信息和时空信息。虽然现有数据集在推进 3D 理解或视频生成方面取得了进展,但在提供规模化支持两者的统一资源方面仍存在显著鸿沟。为弥合这一鸿沟,我们引入 SceneScribe-1M,一个新的大规模多模态视频数据集。它包含一百万份野外视频,每段视频都精细标注了详细的文本描述、精确的相机参数、稠密深度图和一致的 3D 点轨迹。我们通过建立广泛的下游任务基准来展示 SceneScribe-1M 的多样性和价值,包括单目深度估计、场景重建和动态点跟踪,以及有或无相机控制的文本到视频合成。通过开源 SceneScribe-1M,我们旨在提供一个全面的基准和研究的催化剂,推动开发能够感知动态 3D 世界并生成可控、逼真视频内容的模型。
引用
@article{arxiv.2604.07990,
title = {SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations},
author = {Yunnan Wang and Kecheng Zheng and Jianyuan Wang and Minghao Chen and David Novotny and Christian Rupprecht and Yinghao Xu and Xing Zhu and Wenjun Zeng and Xin Jin and Yujun Shen},
journal= {arXiv preprint arXiv:2604.07990},
year = {2026}
}
备注
Accepted by CVPR 2026