中文

通过 MV-ScanQA 多视角推理评估与 TripAlign 预训练数据集提升 3D 场景理解

计算机视觉与模式识别 2025-08-18 v1 多媒体

摘要

3D 视觉语言(3D VL)学习的发展受到现有 3D VL 数据集的多个局限性制约:它们很少需要超越单一视角中靠近物体的推理,且注释常将指令链接到单个物体,缺乏多个物体之间更丰富的语境对齐。这显著限制了能够进行深入、多视角 3D 场景理解以覆盖远程物体的模型开发。为此,我们引入了 MV-ScanQA,一个新的 3D 问答数据集,其中 68% 的问题明确要求整合来自多个视角的信息(与现有数据集不足 7% 相比),从而严格测试多视角组合推理。为促进此类高要求场景的模型训练,我们提出了 TripAlign 数据集,一个大规模且低成本的 2D-3D-语言预训练语料库,包含 100 万个 <2D 视图、3D 物体集合、文本> 三元组,显式地将一组在语境上相关的物体与文本对齐,提供比以前单对象注释更丰富、以视图为基础的多对象多模态对齐信号。我们进一步开发了 LEGO 方法,用于 MV-ScanQA 中的多视角推理任务,将来自预训练 2D LVLMs 的知识迁移到 3D 域中。实验表明,基于 TripAlign 预训练的 LEGO 在我们提出的 MV-ScanQA 上以及现有 3D 密集描述和问答基准测试上均实现了最先进的性能。数据集和代码均可在 https://matthewdm0816.github.io/tripalign-mvscanqa 提供。

关键词

引用

@article{arxiv.2508.11058,
  title  = {Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset},
  author = {Wentao Mo and Qingchao Chen and Yuxin Peng and Siyuan Huang and Yang Liu},
  journal= {arXiv preprint arXiv:2508.11058},
  year   = {2025}
}

备注

Accepeted to ACM MM 25