基于3D场景图的视觉语言预训练框架
计算机视觉与模式识别
2024-12-02 v1
摘要
3D视觉语言(VL)推理因其将潜在连接3D物理世界与自然语言描述的潜力而受到广泛关注。现有方法通常遵循任务特定的高度专业化范式,因此这些方法仅关注有限范围的推理子任务,并严重依赖手工模块和辅助损失。这凸显了需要更简单、统一且通用-purpose模型的需求。本文我们利用3D场景图与自然语言之间的内在联系,提出一种基于3D场景图的视觉语言预训练(VLP)框架。我们的方法利用模态编码器、图卷积层和跨注意力层来学习通用表征,从而适应各种3D VL推理任务,无需针对性设计。预训练目标包括:1)场景图引导的对比学习,利用3D场景图与自然语言之间的强相关性,在不同细粒度水平上对齐3D对象与文本特征;以及2)掩码模态学习,利用跨模态信息来重建被掩码的词语和3D对象。我们不直接重建被掩码对象的数据点云,而是使用位置线索来预测其语义类别。大量实验表明,我们的预训练模型在细化后应用于Several下游任务时,在3D视觉 grounding、3D密集描述和3D问答等任务中达到与现有方法相当或更好的性能。
引用
@article{arxiv.2411.18666,
title = {3D Scene Graph Guided Vision-Language Pre-training},
author = {Hao Liu and Yanni Ma and Yan Liu and Haihong Xiao and Ying He},
journal= {arXiv preprint arXiv:2411.18666},
year = {2024}
}
备注
14 pages, 8 figures, 7 tables