中文

RAG-3DSG:利用重拍摄引导的检索增强生成增强3D场景图

计算机视觉与模式识别 2026-03-17 v2 人工智能 机器人学

摘要

开放词汇的3D场景图(3DSG)通过利用结构化的语义表示可以增强机器人领域的各种下游任务,然而当前的3DSG构建方法由于在遮挡和受限视角下存在噪声的跨图像聚合,导致语义不一致。为了减轻这种不一致性的影响,我们提出了RAG-3DSG,它引入了重拍摄引导的不确定性估计。通过测量原始受限视角与重拍摄最优视角之间的语义一致性,该方法量化了每个图对象的潜在语义模糊性。基于这种量化,我们设计了一种对象级检索增强生成(RAG),利用低不确定性对象作为语义锚点来检索更可靠的上下文知识,使视觉语言模型能够纠正不确定性对象的预测并优化最终的3DSG。在三个具有挑战性的基准测试和真实机器人试验中的广泛评估表明,RAG-3DSG实现了优越的召回率和精确率,有效缓解了语义噪声,为机器人任务提供了高度可靠的场景表示。

关键词

引用

@article{arxiv.2601.10168,
  title  = {RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation},
  author = {Yue Chang and Rufeng Chen and Zhaofan Zhang and Yi Chen and Yifan Tian and Sihong Xie},
  journal= {arXiv preprint arXiv:2601.10168},
  year   = {2026}
}