中文

SignNav:利用标识符实现大规模室内语义可视导航

机器人学 2026-03-18 v1 计算机视觉与模式识别

摘要

人类通常会利用标识符提供的语义线索,在新颖的大规模室内(LSI)环境中(如医院和机场终端)进行导航以到达目的地。然而,在具身化导航领域,这一能力仍未得到充分探索。本文引入一种新颖的具身化导航任务,SignNav,该任务要求智能体解释标识符的语义线索,并根据当前观察结果推理 subsequent action。为促进该领域的研究,我们构建了用于训练和评估各种 SignNav 智能体的 LSI 数据集。LSI 环境中语义线索的动态变化以及标识符稀疏布置为 SignNav 任务带来了显著挑战。为应对这些挑战,我们提出了空间-时间感知变换器(Spatial-Temporal Aware Transformer, START)模型,用于端到端决策。空间感知模块将标识符的语义线索锚定到物理世界,而时间感知模块捕获历史状态与当前观察之间的长程依赖。借助数据聚合(DAgger)的两阶段训练策略,我们的方法实现了最先进的性能,在 val-unseen 数据集上记录了 80% 成功率(Success Rate, SR)和 0.74 NDTW。实际部署进一步证明了该方法在无预构建地图的情况下可在物理环境中实际应用。

关键词

引用

@article{arxiv.2603.16166,
  title  = {SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments},
  author = {Jian Sun and Yuming Huang and He Li and Shuqi Xiao and Shenyan Guo and Maani Ghaffari and Qingbiao Li and Chengzhong Xu and Hui Kong},
  journal= {arXiv preprint arXiv:2603.16166},
  year   = {2026}
}