Sekai:面向世界探索的视频数据集
计算机视觉与模式识别
2025-11-11 v3 人工智能
摘要
视频生成技术取得了显著进展,展望可成为交互式世界探索的基础。然而,现有视频生成数据集不适合世界探索训练, suffers 从以下限制:位置有限、时长短、场景静态、缺乏关于探索和世界的标注。本文介绍 Sekai(日语意为“世界”),一个高质量的、来自全球 100 多个国家和地区、覆盖 750 个城市、包含 5000 小时以上步行或无人机视角(FPV 和 UVA)视频的第一人称视角视频数据集,具备丰富的世界探索标注。我们开发了高效有效的工具箱用于收集、预处理和标注视频,包括位置、场景、天气、人群密度、描述性文字及摄像机轨迹。全面分析和实验表明,该数据集在规模、多样性、标注质量及训练视频生成模型方面均表现优异。我们认为Sekai将推动视频生成和世界探索领域的发展,并激发有价值的应用。项目页面为 https://lixsp11.github.io/sekai-project/。
引用
@article{arxiv.2506.15675,
title = {Sekai: A Video Dataset towards World Exploration},
author = {Zhen Li and Chuanhao Li and Xiaofeng Mao and Shaoheng Lin and Ming Li and Shitian Zhao and Zhaopan Xu and Xinyue Li and Yukang Feng and Jianwen Sun and Zizhen Li and Fanrui Zhang and Jiaxin Ai and Zhixiang Wang and Yuwei Wu and Tong He and Jiangmiao Pang and Yu Qiao and Yunde Jia and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2506.15675},
year = {2025}
}
备注
14 pages, 5 figures