中文

SUM-AgriVLN:面向农业视觉语言导航的空间理解记忆

机器人学 2025-10-17 v1 人工智能

摘要

农业机器人正在成为各种农业任务的强大助手,但仍严重依赖手动操作或固定轨道系统进行移动。AgriVLN 方法和 A2A benchmark 首次将视觉语言导航(VLN)扩展到农业领域,使机器人能够跟随自然语言指令导航至目标位置。在实际农业场景中,导航指令往往反复出现,但 AgriVLN 将每个指令视为独立情节,忽略了过去经验为后续情节提供空间上下文的潜在价值。为弥合这一差距,我们提出了一种称为空间理解记忆(SUM)的农业视觉语言导航方法(SUM-AgriVLN),其中 SUM 模块通过 3D 重建和表示保存空间记忆。我们在 A2A benchmark 上进行评估,结果表明 SUM-AgriVLN 将成功率从 0.47 提升至 0.54,同时导航误差从 2.91m 提升至 2.93m,显示在农业领域实现了最佳性能。代码:https://github.com/AlexTraveling/SUM-AgriVLN。

关键词

引用

@article{arxiv.2510.14357,
  title  = {SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation},
  author = {Xiaobei Zhao and Xingqi Lyu and Xiang Li},
  journal= {arXiv preprint arXiv:2510.14357},
  year   = {2025}
}