中文

弥合 2D 与 3D 视觉问答之间的鸿沟:一种面向 3D VQA 的融合方法

计算机视觉与模式识别 2024-02-27 v1 人工智能 计算与语言 机器学习

摘要

在 3D 视觉问答(3D VQA)中,全标注数据的稀缺以及视觉内容多样性的受限,阻碍了模型向新场景和 3D 概念(例如,ScanQA 和 SQA 数据集中仅使用了约 800 个场景)的泛化。当前方法倾向于利用 2D 信息补充 3D 推理。然而,这些方法面临挑战:要么使用自顶向下的 2D 视图,引入过于复杂且有时与问题无关的视觉线索;要么依赖来自 2D 视觉语言模型(VLMs)的全局聚合场景/图像级表示,从而丢失了细粒度的视觉 - 语言相关性。为克服这些局限,我们的方法采用了一种问题条件化的 2D 视图选择过程,精准定位关键视觉线索所需的语义相关 2D 输入。随后,我们通过一个双分支 Transformer 结构将此 2D 知识集成到 3D-VQA 系统中。该结构采用 Twin-Transformer 设计,紧凑地结合了 2D 和 3D 模态,并捕捉模态间的细粒度相关性,使它们能够相互增强。整合上述机制,我们提出了 BridgeQA,为基于多模态 Transformer 的 3D-VQA 架构提供了新视角。实验验证表明,BridgeQA 在 3D-VQA 数据集上达到了最先进水平(SOTA),并显著优于现有解决方案。代码可在\href\href{https://github.com/matthewdm0816/BridgeQA}{\text{this URL}}获取。

关键词

引用

@article{arxiv.2402.15933,
  title  = {Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA},
  author = {Wentao Mo and Yang Liu},
  journal= {arXiv preprint arXiv:2402.15933},
  year   = {2024}
}

备注

To be published in AAAI 24