中文

构建通用 3D 大规模感知的强预训练基线

计算机视觉与模式识别 2024-05-14 v1

摘要

有效的预训练框架备有通用 3D 表示在感知大规模动态场景中至为重要。然而,在统一不同场景中相同原始件跨越表征方面构建既具通用性又高效率标签的理想框架,仍面临挑战。当前的对比式 3D 预训练方法通常遵循帧级一致性,聚焦于每幅独立图像中的 2D-3D 关系。这种不够周到的一致性极大阻碍了通用预训练框架的前景发展路径:(1) 跨场景语义自冲突,即来自不同场景中相同语义原始件片段间的激烈碰撞;(2) 缺乏推动跨场景语义一致性进入 3D 表示学习的全局统一纽带。为此,我们提出了 CSC 框架,将场景级语义一致性置于核心,桥接不同场景中相似语义片段之间的联系。为实现此目标,我们结合视觉基础模型提供的连贯语义线索与来自互补多模态信息派生的跨场景原型知识。这使我们能够训练一个支持多种下游任务且微调需求更少的通用 3D 预训练模型。经验上,我们在使用其任务特定 3D 网络在 nuScenes 上,对语义分割 (+1.4% mIoU)、目标检测 (+1.0% mAP) 和全景分割 (+3.0% PQ) 相较于 SOTA 预训练方法实现了持续性改进。代码已发布于 https://github.com/chenhaomingbob/CSC,期望激发未来研究。

关键词

引用

@article{arxiv.2405.07201,
  title  = {Building a Strong Pre-Training Baseline for Universal 3D Large-Scale Perception},
  author = {Haoming Chen and Zhizhong Zhang and Yanyun Qu and Ruixin Zhang and Xin Tan and Yuan Xie},
  journal= {arXiv preprint arXiv:2405.07201},
  year   = {2024}
}

备注

Accepted to CVPR 2024