中文

IndustryNav:探索动态工业导航中具身智能体的空间推理

机器人学 2025-11-24 v1 计算机视觉与模式识别

摘要

虽然视觉大语言模型(VLLM)在具身智能体方面显示出巨大的潜力,但它们在空间推理方面仍面临诸多挑战。现有的具身基准主要聚焦于被动、静态的家庭环境,且仅评估孤立的能力,无法捕捉在动态、真实世界复杂性下的整体性能。为填补这一空白,我们提出了 IndustryNav——首个用于主动空间推理的动态工业导航基准测试。IndustryNav 利用 12 个人工创建的高保真 Unity 仓库场景,包含动态物体和人类运动。我们的评估采用 PointGoal 导航管线,有效地将客观视觉与全局 odometry 结合,用于评估整体的局部-全局规划。关键地,我们引入了“碰撞率”和“警告率”指标,以衡量以安全为导向的行为和距离估计。对九款最先进的 VLLM(包括 GPT-5-mini、Claude-4.5 和 Gemini-2.5)的全面研究显示,闭源模型保持一致的优势;然而,所有智能体在鲁棒路径规划、碰撞规避和主动探索方面均表现出显著的不足。这一发现突显了具身研究必须超越被动感知,迈向需要在动态真实环境中实现稳定规划、主动探索和安全行为的任务。

关键词

引用

@article{arxiv.2511.17384,
  title  = {IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation},
  author = {Yifan Li and Lichi Li and Anh Dao and Xinyu Zhou and Yicheng Qiao and Zheda Mai and Daeun Lee and Zichen Chen and Zhen Tan and Mohit Bansal and Yu Kong},
  journal= {arXiv preprint arXiv:2511.17384},
  year   = {2025}
}