SGR3模型:3D场景图检索-推理模型
计算机视觉与模式识别
2026-03-06 v1
摘要
3D场景图提供了对象实体及其关系的结构化表示,使机器人能够进行高层次解释与推理,同时保持对人类直观的可理解性。现有的3D场景图生成方法通常将场景重建与图神经网络(GNN)组合,但此类管道需要多模态数据且可能始终不可得,且依赖于启发式图构建会限制关系三元组的预测。本文引入场景图检索-推理模型3D(SGR3模型),一个无需训练的框架,利用多模态大语言模型(MLLM)结合检索增强生成(RAG)进行语义场景图生成。SGR3模型绕过了显式3D重建的需求,通过纳入通过ColPali风格的跨模态框架检索到的语义对齐场景图来增强关系推理。为提高检索鲁棒性,我们进一步引入加权patch级相似度选择机制,以缓解模糊或语义信息不足区域的负面影响。实验表明,SGR3模型在与无训练基线相当的性能上与GNN-based专家模型持平。此外,对检索模块和知识库规模的消融研究揭示,检索到的外部信息是显式地整合到token生成过程中,而非通过抽象化隐式内化。
引用
@article{arxiv.2603.04614,
title = {SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D},
author = {Zirui Wang and Ruiping Liu and Yufan Chen and Junwei Zheng and Weijia Fan and Kunyu Peng and Di Wen and Jiale Wei and Jiaming Zhang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2603.04614},
year = {2026}
}