仅通过 2D 视觉-语言模型实现 3D 问答
计算机视觉与模式识别
2025-12-08 v2
摘要
大型视觉-语言模型 (LVLMs) 显著推进了众多领域的发展。在本工作中,我们以 3D 问答 (3D-QA) 为代表性示例,探索如何利用其潜力来解决 3D 场景理解任务。由于 3D 领域训练数据有限,我们不训练 LVLMs,而是以零样本方式进行推断。具体而言,我们从 3D 点云中采样 2D 视图,并将其输入 2D 模型以回答给定问题。当选择特定的 2D 模型(例如 LLAVA-OV)时,采样视图的质量最为关键。我们提出了 cdViews,一种用于 3D-QA 自动选择关键且多样化视图的新方法。cdViews 包含两个关键组件:viewSelector 根据视图提供特定答案信息的潜力来优先选择关键视图;viewNMS 通过基于空间重叠移除冗余视图来增强多样性。我们在广泛使用的 ScanQA 和 SQA 基准上评估了 cdViews,结果表明,仅依赖 2D 模型而无需微调,它便在 3D-QA 中取得了 SOTA 性能。这些发现支持了我们的观点,即 2D LVLMs 是目前解决 3D 任务的最有效替代方案(相较于资源密集型的 3D LVLMs)。
引用
@article{arxiv.2505.22143,
title = {3D Question Answering via only 2D Vision-Language Models},
author = {Fengyun Wang and Sicheng Yu and Jiawei Wu and Jinhui Tang and Hanwang Zhang and Qianru Sun},
journal= {arXiv preprint arXiv:2505.22143},
year = {2025}
}
备注
ICML2025