中文

OpenDlign:基于深度对齐图像的开放世界点云理解

计算机视觉与模式识别 2024-10-01 v3

摘要

近期使用视觉语言模型(Vision-Language Models, VLMs)将 3D 点云与图像-文本信息对齐的开放世界 3D 表示学习方法显示出优异的 3D 零样性能。然而,CAD 渲染图像往往缺乏真实感和纹理变化,导致对齐鲁棒性受损。此外,3D 与 2D 前训练数据集的体积差异凸显了需要有效策略将 VLMs 的表征能力有效迁移到 3D 学习中的挑战。本文提出了 OpenDlign,一种新型开放世界 3D 模型,使用来自扩散模型生成的深度对齐图像实现稳健的多模态对齐。这些图像由于扩散模型的随机性,具有更丰富的纹理多样性。通过改进深度图投影管道并设计深度专用提示词,OpenDlign 能充分利用预训练 VLMs 中的丰富知识进行 3D 表示学习,并实现简化的微调。我们的实验表明,OpenDlign 在 diverse 3D 任务上实现了高水平的零样和少样性能,仅需在有限的 ShapeNet 数据集上对 600 万参数进行微调。 在零样分类任务中,OpenDlign 在 ModelNet40 上的性能提升了 8.0%,在 OmniObject3D 上的性能提升了 16.4%。此外,使用深度对齐图像进行多模态对齐始终能显著提升其他先进模型的性能。

关键词

引用

@article{arxiv.2404.16538,
  title  = {OpenDlign: Open-World Point Cloud Understanding with Depth-Aligned Images},
  author = {Ye Mao and Junpeng Jing and Krystian Mikolajczyk},
  journal= {arXiv preprint arXiv:2404.16538},
  year   = {2024}
}

备注

17 pages (Accepted by NeurIPS 2024)