中文

BlendCLIP:用于零样态 3D 目标分类的多模态预训练框架,桥接合成与真实域

计算机视觉与模式识别 2025-10-22 v1

摘要

零样态 3D 目标分类对于实际应用如自动驾驶等至关重要,但常受合成数据用于训练与稀疏、嘈杂 LiDAR 扫描在真实世界中遇到的显著域间差距的制约。当前仅在合成数据上训练的方法难以泛化到户外场景,而仅在真实数据上训练的方法则缺乏识别稀有或未见对象所需的语义多样性。我们提出 BlendCLIP,一种多模态预训练框架,用于桥接合成与真实域之间的差距,充分利用两者的优势。我们首先提出了从真实驾驶数据和人工标注的 3D 框中挖掘出大规模对象级三元组数据集,包含点云、图像和文本描述。我们的核心贡献是基于课程的混合数据策略:首先在语义丰富的合成 CAD 数据上进行 grounding,然后逐步适应真实世界扫描的特定特征。我们的实验表明,该方法高度标签高效:仅引入 1.5% 的真实世界样本即可提升 nuScenes 基准测试上的零样态准确率 27%。因此,我们的最终模型在 nuScenes 和 TruckScenes 等具有挑战性的户外数据集上实现了最先进的性能,相较于最佳先前方法在 nuScenes 上提升 19.3%,同时在多样化的合成基准上保持强大的泛化能力。我们的发现表明,有效的域适应而非全规模真实世界标注,才是解锁稳健开放词汇 3D 感知的关键。我们的代码和数据集将在接受录取后发布于 https://github.com/kesu1/BlendCLIP

关键词

引用

@article{arxiv.2510.18244,
  title  = {BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining},
  author = {Ajinkya Khoche and Gergő László Nagy and Maciej Wozniak and Thomas Gustafsson and Patric Jensfelt},
  journal= {arXiv preprint arXiv:2510.18244},
  year   = {2025}
}

备注

Under Review