中文

Multi-CLIP:面向 3D 场景问答任务的对比视觉-语言预训练

计算机视觉与模式识别 2023-06-12 v1

摘要

训练模型将来自 2D 图像的常识语言知识与视觉概念应用于 3D 场景理解,是一个颇有前景且研究者近期才开始探索的方向。然而,2D 蒸馏知识能否为 3D 视觉-语言下游任务(如 3D 问答)提供有用表征,仍研究不足。本文提出一种新颖的 3D 预训练视觉-语言方法,即 Multi-CLIP,使模型能够学习语言接地且可迁移的 3D 场景点云表征。我们通过对比目标最大化编码的 3D 场景特征与 CLIP 空间中相应 2D 多视角图像及文本嵌入之间的一致性,从而利用 CLIP 模型的表征能力。为验证我们的方法,我们考虑了 3D 视觉问答(3D-VQA)与 3D 情境问答(3D-SQA)这些具挑战性的下游任务。为此,我们开发了基于多模态 transformer 的新颖架构,并展示了我们的预训练方法如何提升其性能。定量与定性实验结果表明,Multi-CLIP 在 3D-VQA 与 3D-SQA 下游任务上优于最先进工作,并带来结构良好的 3D 场景特征空间。

关键词

引用

@article{arxiv.2306.02329,
  title  = {Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes},
  author = {Alexandros Delitzas and Maria Parelli and Nikolas Hars and Georgios Vlassis and Sotirios Anagnostidis and Gregor Bachmann and Thomas Hofmann},
  journal= {arXiv preprint arXiv:2306.02329},
  year   = {2023}
}

备注

The first two authors contributed equally. arXiv admin note: text overlap with arXiv:2304.06061