UniT3D:用于 3D 密集描述与视觉定位的统一 Transformer
计算机视觉与模式识别
2022-12-05 v1
摘要
执行 3D 密集描述与视觉定位需要对底层多模态关系有共同且共享的理解。然而,尽管先前有一些尝试用高度任务特定的神经模块连接这两个相关任务,如何显式刻画它们的共享本质以同时学习仍研究不足。本工作中,我们提出 UniT3D,一种简单而有效的完全统一基于 Transformer 的架构,用于联合求解 3D 视觉定位与密集描述。UniT3D 通过带有双向与序列到序列目标的监督联合预训练方案,使两个任务间学习到强的多模态表示。借助通用架构设计,UniT3D 允许将预训练范围扩展到更多样的训练来源,例如来自 2D 先验知识的合成数据,以惠及 3D 视觉-语言任务。大量实验与分析表明 UniT3D 在 3D 密集描述与视觉定位上取得显著增益。
引用
@article{arxiv.2212.00836,
title = {UniT3D: A Unified Transformer for 3D Dense Captioning and Visual Grounding},
author = {Dave Zhenyu Chen and Ronghang Hu and Xinlei Chen and Matthias Nießner and Angel X. Chang},
journal= {arXiv preprint arXiv:2212.00836},
year = {2022}
}