中文

基于大规模合成数据的3D视觉与语言预训练

计算机视觉与模式识别 2024-07-09 v1

摘要

3D视觉-语言预训练(3D-VLP)旨在提供一个能够桥接3D场景与自然语言的预训练模型,这是具身智能的一项重要技术。然而,当前的3D-VLP数据集受到场景级多样性有限和细粒度标注不足(ScanScribe中仅有1.2K场景和280K文本标注)的阻碍,这主要是由于收集和标注3D场景的劳动密集型特性。为了克服这些障碍,我们构建了SynVL3D,一个包含10K室内场景和100万条对象、视图和房间级别描述的综合合成场景-文本语料库,具有场景数据多样、文本描述丰富、多粒度3D-文本关联和低收集成本等优点。利用SynVL3D中丰富的标注,我们预训练了一个简单统一的Transformer,通过多粒度预训练任务来对齐3D和语言。此外,我们在下游任务微调过程中提出了一种合成到真实的域自适应方法以解决域偏移问题。通过大量实验,我们通过在包括视觉定位、密集描述和问答在内的下游任务上取得最先进性能,验证了我们模型设计的有效性。

关键词

引用

@article{arxiv.2407.06084,
  title  = {3D Vision and Language Pretraining with Large-Scale Synthetic Data},
  author = {Dejie Yang and Zhu Xu and Wentao Mo and Qingchao Chen and Siyuan Huang and Yang Liu},
  journal= {arXiv preprint arXiv:2407.06084},
  year   = {2024}
}

备注

accepted by IJCAI2024