GIST:通过智能语义拓扑进行多模态知识提取与空间锚定
人工智能
2026-04-20 v1 计算机视觉与模式识别
人机交互
机器人学
摘要
在零售店、仓库和医院等复杂、密集的环境中导航,对人类和具身人工智能都构成了重大的空间锚定挑战。在这些空间中,由于物品的准静态特性,密集的视觉特征会迅速过时,而长尾语义分布对传统计算机视觉构成挑战。虽然视觉-语言模型(VLMs)帮助辅助系统在语义丰富的空间中导航,但它们仍然难以在杂乱环境中进行空间锚定。我们提出了 GIST(锚定智能语义拓扑),一个多模态知识提取流程,它将消费级移动点云转换为语义标注的导航拓扑。我们的架构将场景提炼为二维占用地图,提取其拓扑布局,并通过智能关键帧和语义选择覆盖轻量级语义层。我们通过关键的下游人机交互任务展示了这种结构化空间知识的通用性:(1) 一个意图驱动的语义搜索引擎,在精确匹配失败时主动推断类别替代方案和区域;(2) 一个单样本语义定位器,实现了 1.04 米的 Top-5 平均平移误差;(3) 一个区域分类模块,将可行走的平面图分割为高级语义区域;(4) 一个视觉锚定的指令生成器,将最优路径合成为以自我为中心、富含地标的自然语言路线。在多标准大语言模型评估中,GIST 优于基于序列的指令生成基线。最后,一项现场形成性评估(N=5)仅依靠口头提示就达到了 80% 的导航成功率,验证了该系统面向通用设计的能力。
引用
@article{arxiv.2604.15495,
title = {GIST: Multimodal Knowledge Extraction and Spatial Grounding via Intelligent Semantic Topology},
author = {Shivendra Agrawal and Bradley Hayes},
journal= {arXiv preprint arXiv:2604.15495},
year = {2026}
}