中文

3D-MoRe:用于具身问答的统一模态-语境推理

计算机视觉与模式识别 2025-09-26 v2

摘要

随着室内场景任务(如问答和密集标注)需求日益增长,需要多样化且可扩展的数据。我们提出3D-MoRe,一种新颖的范式,通过利用基础模型的优势来生成大规模3D语言数据集。该框架集成了多模态嵌入、跨模态交互和语言模型解码器等关键组件,用于处理自然语言指令和3D场景数据。这种方法促进了在复杂3D环境中的推理和响应生成。使用ScanNet 3D场景数据集,以及来自ScanQA和ScanRefer的文本标注,3D-MoRe生成了62,000个问答对和73,000个对象描述,涵盖1,513个场景。我们还采用了多种数据增强技术并实现了语义过滤,以确保数据质量。在ScanQA上的实验表明,3D-MoRe显著优于最先进的基线方法,CIDEr分数提升了2.15%。在ScanRefer上,我们的方法在[email protected]上实现了显著提升,提升了1.84%,凸显了其在两种任务中的有效性。我们将公开代码和生成的数据集以供社区使用,两者均可在 https://3D-MoRe.github.io 访问。

关键词

引用

@article{arxiv.2507.12026,
  title  = {3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering},
  author = {Rongtao Xu and Han Gao and Mingming Yu and Dong An and Shunpeng Chen and Changwei Wang and Li Guo and Xiaodan Liang and Shibiao Xu},
  journal= {arXiv preprint arXiv:2507.12026},
  year   = {2025}
}

备注

Accepted by IROS 2025