SpatialVID:大规模带空间注释的视频数据集
计算机视觉与模式识别
2025-12-19 v2
摘要
在空间智能领域,包括空间重建和世界探索方面,已取得显著进展。然而,当前模型的规模和现实真实性严重受限于大规模高质量训练数据的稀缺。虽然有多个数据集提供相机姿态信息,但通常在规模、多样性和注释丰富性方面有限,尤其是针对真实世界动态场景的真实相机运动。为此,我们收集 SpatialVID,一个由大量野外视频组成的数据集,包含多样化的场景、相机运动和稠密 3D 注释,如每帧相机姿态、深度和运动指令。具体而言,我们收集了超过 21,000 小时的原始视频,并通过分层过滤管道将其处理为 270 万个片段,总时长达 7,089 小时动态内容。随后,一个注释管道为这些片段添加详细的空间和语义信息,包括相机姿态、深度图、动态掩码、结构化描述和序列化运动指令。对 SpatialVID 数据统计进行分析显示,其丰富性和多样性直接促进了模型的泛化和性能,使其成为视频和 3D 视觉研究社区的关键资产。
引用
@article{arxiv.2509.09676,
title = {SpatialVID: A Large-Scale Video Dataset with Spatial Annotations},
author = {Jiahao Wang and Yufeng Yuan and Rujie Zheng and Youtian Lin and Jian Gao and Lin-Zhuo Chen and Yajie Bao and Yi Zhang and Chang Zeng and Yanxi Zhou and Xiao-Xiao Long and Hao Zhu and Zhaoxiang Zhang and Xun Cao and Yao Yao},
journal= {arXiv preprint arXiv:2509.09676},
year = {2025}
}
备注
Project page: https://nju-3dv.github.io/projects/SpatialVID/