中文

SONAR:基于跨模态推理的语义对象导航

机器人学 2025-09-30 v1

摘要

理解人类指令并在未知环境中完成视觉-语言导航任务对机器人而言是必不可少的。然而,现有的模块化方法严重依赖训练数据的质量,往往表现出较差的泛化能力。而基于视觉-语言模型的方法虽然展示了强大的泛化能力,但在语义线索较弱时往往表现不佳。为此,本文提出SONAR,通过跨模态范式实现聚合推理。该方法将基于语义地图的目标预测模块与基于视觉-语言模型的值图模块集成,实现了在语义线索水平各异的未知环境中更稳健的导航,并有效平衡了泛化能力与场景适应性。在目标定位方面,我们提出了一种将多尺度语义地图与置信度图集成的策略,旨在缓解目标对象的误检。在Gazebo模拟器中对SONAR进行了评估,采用最具挑战性的Matterport 3D(MP3D)数据集作为实验基准。实验结果表明,SONAR实现了38.4%的成功率和17.7%的SPL。

关键词

引用

@article{arxiv.2509.24321,
  title  = {SONAR: Semantic-Object Navigation with Aggregated Reasoning through a Cross-Modal Inference Paradigm},
  author = {Yao Wang and Zhirui Sun and Wenzheng Chi and Baozhi Jia and Wenjun Xu and Jiankun Wang},
  journal= {arXiv preprint arXiv:2509.24321},
  year   = {2025}
}