中文

3D-VisTA:用于三维视觉与文本对齐的预训练 Transformer

计算机视觉与模式识别 2023-08-09 v1

摘要

三维视觉-语言接地(3D-VL)是一个新兴领域,旨在将三维物理世界与自然语言相连接,这对于实现具身智能至关重要。当前的 3D-VL 模型严重依赖复杂的模块、辅助损失和优化技巧,这呼唤一种简单且统一的模型。本文中,我们提出 3D-VisTA,一种用于三维视觉与文本对齐的预训练 Transformer,可轻松适配各种下游任务。3D-VisTA 简单地利用自注意力层进行单模态建模和多模态融合,无需任何复杂的任务特定设计。为了进一步提升其在 3D-VL 任务上的性能,我们构建了 ScanScribe,首个用于 3D-VL 预训练的大规模三维场景-文本对数据集。ScanScribe 包含源自 ScanNet 和 3R-Scan 数据集的 1,185 个独特室内场景的 2,995 个 RGB-D 扫描,以及由现有 3D-VL 任务、模板和 GPT-3 生成的 278K 配对场景描述。3D-VisTA 在 ScanScribe 上通过掩码语言/物体建模和场景-文本匹配进行预训练。它在从视觉接地和密集描述到问答和情境推理的各种 3D-VL 任务上均取得了最先进(state-of-the-art, SOTA)结果。此外,3D-VisTA 展现出优越的数据效率,即使在下游任务微调时标注有限也能获得强劲性能。

关键词

引用

@article{arxiv.2308.04352,
  title  = {3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment},
  author = {Ziyu Zhu and Xiaojian Ma and Yixin Chen and Zhidong Deng and Siyuan Huang and Qing Li},
  journal= {arXiv preprint arXiv:2308.04352},
  year   = {2023}
}