OmniVLN:面向空中与地面平台的全向 3D 感知与高效 LLM 推理的视觉-语言导航
机器人学
2026-03-19 v1
摘要
语言引导的具身导航要求智能体解释对象指称指令,跨越多个房间搜索,定位目标对象,并执行可靠的运动前进。现有系统在实际室内环境中受限于窄视场感知,每一步只暴露局部场景的部分内容,常迫使重复旋转,延迟目标发现,产生碎片化的空间理解;同时,直接将稠密 3D 地图或详尽对象列表输入 LLM 会迅速超出上下文预算。我们提出 OmniVLN,一个零样本视觉-语言导航框架,融合全向 3D 感知与高效分层推理,适用于空中和地面机器人。OmniVLN 将旋转激光雷达和全景视觉融合到硬件无关的映射堆栈中,逐步构建从网格几何到房间和建筑层次结构的五层动态场景图 (DSG),通过持久同质分析-based 房间分区和混合几何/VLM 关系验证稳定高层拓扑。对于导航,将全局 DSG 转换为以代理中心为导向的 3D 八分之一表示,采用多分辨率空间注意力提示,使 LLM 能够逐步筛选候选房间,推断自身姿态,定位目标对象,并发出可执行的导航原语,同时保持细节局部信息和紧凑的远程记忆。实验表明,所提出的分层接口将空间指称准确率从 77.27% 提升至 93.18%,在杂乱多房间环境中累计提示 token 减少最高可达 61.7%,导航成功率相较于平面列表基线提升最高可达 11.68%。我们将发布代码和一个全向多模态数据集,以支持可重复的研究。
引用
@article{arxiv.2603.17351,
title = {OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms},
author = {Zhongyuang Liu and Min He and Shaonan Yu and Xinhang Xu and Muqing Cao and Jianping Li and Jianfei Yang and Lihua Xie},
journal= {arXiv preprint arXiv:2603.17351},
year = {2026}
}