面向视觉语言导航的开放集语义分组的 3D 高斯图
计算机视觉与模式识别
2026-05-27 v1
摘要
视觉语言导航 (Vision-language navigation, VLN) 需要智能体基于自然语言指令在复杂的 3D 环境中遍历,这需要彻底的场景理解。虽然已有工作为增强空间感知能力而为智能体提供各种场景表示,但往往忽视 VLN 场景中复杂的 3D 几何和丰富的语义,限制了其在多样且未见环境中的泛化能力。为此,本工作提出一种 3D 高斯图 (3D Gaussian Map),将环境表示为一组可微分的 3D 高斯,并据此开发针对 VLN 的导航策略。具体而言,基于稀疏伪激光点云初始化在线构建 Egocentric Scene Map,为场景理解提供有益的几何先验。每个 3D 高斯原语通过基于其在开放世界中所属对象实例或 stuff 类别的成员身份进行开放集语义分组而进一步丰富,从而形成统一的 3D 高斯图。基于该图,设计了结合多粒度空间语义线索的 Multi-Level Action Prediction 策略,以辅助智能体决策。在三个公开基准 (即 R2R、R4R 和 REVERIE) 上的广泛实验验证了本方法的有效性。
引用
@article{arxiv.2605.26500,
title = {3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation},
author = {Jianzhe Gao and Rui Liu and Wenguan Wang},
journal= {arXiv preprint arXiv:2605.26500},
year = {2026}
}