Hypo3D:探索三维中的假设推理
计算机视觉与模式识别
2025-05-29 v3
摘要
视觉-语言基础模型的兴起标志着在弥合人类与机器在三维场景推理能力差距方面取得了进展。现有的三维推理基准假设实时场景可访问,但由于频繁更新场景的高昂成本,这并不切实际。为此,我们引入了假设三维推理,即 Hypo3D,这是一个旨在评估模型在无法访问实时场景数据时进行推理能力的基准。模型需要根据提供的场景变化描述来想象场景状态,然后进行推理。Hypo3D 被构建为一个三维视觉问答(VQA)基准,包含 700 个室内场景中的 7,727 个上下文变化,产生了 14,885 个问答对。为所有场景建立了一个基于锚点的世界坐标系,确保上下文变化和问答中的方向性术语一致地参考全局坐标系。大量实验表明,最先进的基础模型在假设变化的场景中难以进行推理。这揭示了与人类相比存在显著的性能差距,尤其是在涉及移动变化和方向推理的场景中。即使上下文变化与问题无关,模型也常常错误地调整其答案。项目网站:https://matchlab-imperial.github.io/Hypo3D/
引用
@article{arxiv.2502.00954,
title = {Hypo3D: Exploring Hypothetical Reasoning in 3D},
author = {Ye Mao and Weixun Luo and Junpeng Jing and Anlan Qiu and Krystian Mikolajczyk},
journal= {arXiv preprint arXiv:2502.00954},
year = {2025}
}
备注
24 pages, 15 figures, 15 tables