中文

Leader360V:面向多任务学习的大规模真实360视频数据集

计算机视觉与模式识别 2025-06-18 v1

摘要

360 视频以 360X180 的超大视野捕获完整周围场景,使得分割、跟踪等 360 场景理解任务成为重要应用场景,如自动驾驶、机器人技术。然而,由于缺乏大规模标定真实世界数据集,基础模型的社区进步受到阻碍。这源于球面特性的固有限制,例如极地区域严重畸变和内容不连续,使得标注成本高昂且复杂。本文介绍 Leader360V,这是首个用于实例分割和跟踪的大规模标定真实世界360视频数据集。该数据集具备丰富的场景多样性,涵盖室内、城市、自然及动态户外场景。为实现自动标注,我们设计了自动标注管道,通过协调预训练的 2D 分割器与大语言模型,有效促进标注过程。该管道包含三个新颖阶段。首先,在初始标注阶段,我们引入语义和畸变感知细化模块,将来自多个 2D 分割器的目标掩码提案与由大语言模型验证的语义标签结合,随后转换为掩码提示以指导 SAM2 生成后续帧的畸变感知掩码。在自动细化标注阶段,若存在漏标或不完整区域,可通过再次应用 SDR 或解决水平边界附近的不连续性来进行修正。在手动修订阶段,最终通过大语言模型和人类标注员进一步细化和验证标注。大量用户研究和评估表明,我们的标注管道有效且高效。同时,实验表明 Leader360V 在 360 视频分割和跟踪方面显著提升模型性能,为更可扩展的 360 场景理解铺平了道路。

关键词

引用

@article{arxiv.2506.14271,
  title  = {Leader360V: The Large-scale, Real-world 360 Video Dataset for Multi-task Learning in Diverse Environment},
  author = {Weiming Zhang and Dingwen Xiao and Aobotao Dai and Yexin Liu and Tianbo Pan and Shiqi Wen and Lei Chen and Lin Wang},
  journal= {arXiv preprint arXiv:2506.14271},
  year   = {2025}
}

备注

23 pages, 16 figures