3D 场景理解的统一框架
计算机视觉与模式识别
2024-11-28 v2
摘要
我们提出 UniSeg3D,一个统一的 3D 场景理解框架,在单个模型中实现全景、语义、实例、交互式、指代和开放词汇分割任务。大多数以往的 3D 分割方法通常针对特定任务进行设计,限制了其对 3D 场景理解仅限于任务特定的视角。相反,所提方法将六个任务统一到统一的表示中,通过相同的 Transformer 处理。它促进了任务之间知识共享,从而推动了全面的 3D 场景理解。为了充分利用多任务统一,我们通过建立明确的任务间关联来提升性能。具体而言,我们设计了知识蒸馏和对比学习方法,以跨任务传递任务特定知识。在三个基准测试(包括 ScanNet20、ScanRefer 和 ScanNet200)上的实验表明,UniSeg3D 在各种指标上 consistently 优于当前 SOTA 方法,即使这些方法针对单个任务进行专业化设计。我们希望 UniSeg3D 能作为坚实的统一基线并激发未来工作。代码和模型已发布于 https://github.com/dk-liang/UniSeg3D。
引用
@article{arxiv.2407.03263,
title = {A Unified Framework for 3D Scene Understanding},
author = {Wei Xu and Chunsheng Shi and Sifan Tu and Xin Zhou and Dingkang Liang and Xiang Bai},
journal= {arXiv preprint arXiv:2407.03263},
year = {2024}
}
备注
Accepted to NeurIPS 2024. Code and models are available at https://github.com/dk-liang/UniSeg3D