通过可提示查询统一 3D 视觉语言理解
计算机视觉与模式识别
2024-07-25 v2
摘要
期望一种统一模型用于 3D 视觉语言(3D-VL)理解,能够处理各种场景表征并在 3D 场景中执行广泛的任务。然而,由于现有方法独立应用表征且不足够探索 3D 多任务训练,已有方法与此目标之间存在显著差距。本文引入了 PQ3D,一种能够利用可提示查询(Promptable Queries)来解决广泛 3D-VL 任务的统一模型,涵盖从低层实例分割到高层推理与规划等各种任务。这通过三个关键创新实现:(1)通过分段级分组将各种 3D 场景表征(即体素、点云、多视图图像)统一到共享的 3D 坐标空间中;(2)基于注意力的查询解码器,以提示为导向进行任务特定信息检索;(3)为不同任务提供通用输出头以支持多任务训练。在测试十个 diverse 3D-VL 数据集时,PQ3D 在这些任务上表现突出,为大多数基准设置了新纪录。特别地,PQ3D 在 ScanNet200 上将 AP25 提升 4.9%,在 ScanRefer 上将 [email protected] 提升 5.4%,在 Multi3DRefer 上将 [email protected] 提升 11.7%,在 Scan2Cap 上将 [email protected] 提升 13.4%。此外,PQ3D 支持使用单个或组合形式的可用 3D 表征进行灵活推理,例如仅使用体素输入。
引用
@article{arxiv.2405.11442,
title = {Unifying 3D Vision-Language Understanding via Promptable Queries},
author = {Ziyu Zhu and Zhuofan Zhang and Xiaojian Ma and Xuesong Niu and Yixin Chen and Baoxiong Jia and Zhidong Deng and Siyuan Huang and Qing Li},
journal= {arXiv preprint arXiv:2405.11442},
year = {2024}
}
备注
ECCV 2024. Project page: https://pq3d.github.io