DSPNet:用于鲁棒 3D 问答的双视觉场景感知
计算机视觉与模式识别
2025-03-07 v2
摘要
3D 问答(3D QA)要求模型全面理解由文本描述的所处 3D 场景,然后推理其周围环境并在该情境下回答问题。然而,现有方法通常仅依赖来自纯 3D 点云的全局场景感知,而忽略了来自多视角图像的丰富局部纹理细节的重要性。此外,由于相机姿态的固有噪声和复杂的遮挡,在将 3D 点云与多视角图像对齐时存在显著的特征退化以及特征鲁棒性降低的问题。在本文中,我们提出了双视觉场景感知网络(DSPNet),以全面整合多视角和点云特征来提高 3D QA 的鲁棒性。我们的文本引导多视角融合(TGMF)模块优先选择与文本语义内容最匹配的画面视角。为了自适应地将反投影的多视角图像与点云特征融合,我们设计了自适应双视觉感知(ADVP)模块,增强了 3D 场景理解。此外,我们的多模态上下文引导推理(MCGR)模块通过整合视觉和语言模态中的上下文信息来促进鲁棒推理。在 SQA3D 和 ScanQA 数据集上的实验结果证明了 DSPNet 的优越性。代码将在 https://github.com/LZ-CH/DSPNet 上提供。
引用
@article{arxiv.2503.03190,
title = {DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering},
author = {Jingzhou Luo and Yang Liu and Weixing Chen and Zhen Li and Yaowei Wang and Guanbin Li and Liang Lin},
journal= {arXiv preprint arXiv:2503.03190},
year = {2025}
}
备注
Accepted by CVPR 2025