MUVOD:面向3D分割的新型多视图视频对象分割数据集与基准
计算机视觉与模式识别
2025-07-11 v1
摘要
基于神经辐射场(NeRF)和3D高斯溶解(3D GS)的方法在静态场景的3D对象分割领域 steadily 获得了越来越大的关注。这些方法在 various 3D场景理解和编辑任务中 demonstrate 了有效性。然而,由于缺乏足够广泛且标注准确的多视图视频数据集,动态场景的4D对象分割仍是一个 underexplored 的领域。本文提出了 MUVOD,一个用于训练和评估重建真实场景中对象分割的多视图视频数据集。该数据集选取了17个场景,描述各种室内或户外活动,来自不同来源的数据集,来自各种类型的摄像机 rig。每个场景包含至少9个视图,最多46个视图。我们提供了7830个RGB图像(每个视频30帧),并提供相应的4D运动分割掩码,意味着在给定视图的不同时间帧或属于同一摄像机 rig 的不同视图之间,都可以跟踪场景中任何感兴趣的对象。该数据集包含459个73个类别的实例,旨作为评估多视图视频分割方法的基准。我们还提供了一个评估指标和一个基准分割方法,以鼓励和评估 this evolving field 中的 progress。此外,我们提出了一个新的 3D 对象分割基准,使用从 MUVOD 数据集中选取的子集中标注的多视图图像,该子集包含50个不同条件下的对象,涵盖 various 场景,为评估最新 3D 对象分割方法提供了更全面的分析。我们的 MUVOD 数据集可在 https://volumetric-repository.labs.b-com.com/#/muvod 查阅。
引用
@article{arxiv.2507.07519,
title = {MUVOD: A Novel Multi-view Video Object Segmentation Dataset and A Benchmark for 3D Segmentation},
author = {Bangning Wei and Joshua Maraval and Meriem Outtas and Kidiyo Kpalma and Nicolas Ramin and Lu Zhang},
journal= {arXiv preprint arXiv:2507.07519},
year = {2025}
}