中文

Uni3DL:面向三维与语言理解的统一模型

计算机视觉与模式识别 2023-12-07 v1

摘要

本文提出了Uni3DL,一个面向三维与语言理解的统一模型。与现有三维领域中任务种类有限且主要依赖投影多视图图像的统一视觉-语言模型不同,Uni3DL直接对点云进行操作。这种方法显著扩展了三维支持任务的范围,涵盖了三维视觉任务和三维视觉-语言任务。Uni3DL的核心设计了一个查询Transformer,通过关注三维视觉特征来学习与任务无关的语义和掩码输出,并采用一个任务路由器来有选择地生成不同任务所需的特定任务输出。凭借统一的架构,我们的Uni3DL模型实现了无缝的任务分解和跨任务的大量参数共享。Uni3DL已在多种三维视觉-语言理解任务上进行了严格评估,包括语义分割、目标检测、实例分割、视觉定位、三维描述以及文本-三维跨模态检索。其性能与最先进(SOTA)的特定任务模型相当或更优。我们希望我们的基准测试和Uni3DL模型能够成为推动三维与语言理解领域统一模型未来研究的一个坚实步骤。项目页面:https://uni3dl.github.io。

关键词

引用

@article{arxiv.2312.03026,
  title  = {Uni3DL: Unified Model for 3D and Language Understanding},
  author = {Xiang Li and Jian Ding and Zhaoyang Chen and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2312.03026},
  year   = {2023}
}