KeySG:基于关键帧的层次化3D场景图
计算机视觉与模式识别
2026-03-24 v2 机器人学
摘要
近年来,3D场景图作为一种强大的世界表示形式出现,同时提供了几何精度和语义丰富性。将3D场景图与大语言模型相结合,使机器人能够在复杂的人机共存环境中进行推理、规划和导航。然而,当前构建3D场景图的方法在语义上局限于预定义的关系集合,且其在大型环境中的序列化很容易超出LLM的上下文窗口。我们引入了KeySG,这是一个将3D场景表示为由楼层、房间、对象和功能元素组成的层次化图的框架,其中节点通过从关键帧中提取的多模态信息进行增强,这些关键帧经过选择以优化几何和视觉覆盖率。关键帧使我们能够高效利用VLM来提取场景信息,从而减轻了对对象之间关系边进行显式建模的需求,实现了更通用的、与任务无关的推理和规划。我们的方法可以处理复杂且模糊的查询,同时通过利用层次化多模态检索增强生成(RAG)管道从图中提取相关上下文,缓解了与大型场景图相关的可扩展性问题。在三个不同的基准(3D对象语义分割、功能元素分割和复杂查询检索)上进行评估,KeySG在大多数指标上优于现有方法,证明了其卓越的语义丰富性和效率。
引用
@article{arxiv.2510.01049,
title = {KeySG: Hierarchical Keyframe-Based 3D Scene Graphs},
author = {Abdelrhman Werby and Dennis Rotondi and Fabio Scaparro and Kai O. Arras},
journal= {arXiv preprint arXiv:2510.01049},
year = {2026}
}
备注
Code and video are available at https://keysg-lab.github.io/