中文

多摄像头视频下的X射线视力训练:无遮挡分割、无遮挡内容完成与全视角对象表示

计算机视觉与模式识别 2025-07-02 v1 人工智能

摘要

无遮挡分割和无遮挡内容完成需要利用对象先验来估计遮挡掩码和遮挡后对象特征。迄今为止,尚无数据集提供了额外的维度作为对象上下文:多摄像机共享场景视角的可能性。我们引入MOVi-MC-AC:Multiple Object Video with Multi-Cameras and Amodal Content(多对象多摄像头无遮挡内容视频),这是目前规模最大的无遮挡分割数据集且首个提供无遮挡内容的数据集。我们在多摄像机视频中模拟了通用家庭对象的狭密场景。MOVi-MC-AC为目标检测、跟踪和分割的日益增长的文献提供了两个新的贡献:多摄像机(MC)设置下,对象可以在各种独特摄像机视角之间被识别和跟踪,这在合成和真实世界视频中都很少见。我们通过提供一致的对象ID来引入合成视频的新复杂度,这些ID用于检测和分割,在帧和多个摄像机之间保持一致,每个摄像机都具有独特的特征和运动模式。无遮挡内容(AC)是一种重建任务,模型需预测遮挡后目标对象的外观。在无遮挡分割文献中,一些数据集已发布带有无遮挡检测、跟踪和分割标签的无遮挡内容。虽然其他方法依赖缓慢的剪切粘贴方案生成无遮挡内容伪标签,但它们不考虑模态掩码中存在的自然遮挡。MOVi-MC-AC提供约580万个对象实例的标签,创下无遮挡数据集文献中的新纪录,同时首次提供真实无遮挡内容。完整数据集可在https://huggingface.co/datasets/Amar-S/MOVi-MC-AC 获取。

关键词

引用

@article{arxiv.2507.00339,
  title  = {Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video},
  author = {Alexander Moore and Amar Saini and Kylie Cancilla and Doug Poland and Carmen Carrano},
  journal= {arXiv preprint arXiv:2507.00339},
  year   = {2025}
}

备注

9 pages, 2 figures