面向 3D 场景问答的 CLIP 引导视觉-语言预训练
计算机视觉与模式识别
2023-04-14 v1
摘要
训练模型将来自 2D 图像的 linguistic 知识与视觉概念应用于 3D 世界理解,是一个颇有前景且研究者最近才开始探索的方向。在本工作中,我们设计了一种新颖的 3D 预训练视觉-语言方法,帮助模型学习具有语义意义且可迁移的 3D 场景点云表示。我们通过将编码的 3D 场景特征与 CLIP 生成的对应 2D 图像及文本嵌入对齐,将流行 CLIP 模型的表征能力注入我们的 3D 编码器。为评估模型的 3D 世界推理能力,我们在 3D 视觉问答下游任务上对其进行评测。定量与定性实验结果表明,我们的预训练方法在该任务上优于最先进工作,并带来可解释的 3D 场景特征表示。
引用
@article{arxiv.2304.06061,
title = {CLIP-Guided Vision-Language Pre-training for Question Answering in 3D Scenes},
author = {Maria Parelli and Alexandros Delitzas and Nikolas Hars and Georgios Vlassis and Sotirios Anagnostidis and Gregor Bachmann and Thomas Hofmann},
journal= {arXiv preprint arXiv:2304.06061},
year = {2023}
}
备注
CVPRW 2023. Code will be made publicly available: https://github.com/AlexDelitzas/3D-VQA