中文

MDE-AgriVLN:基于单目深度估计的农业视觉语言导航

机器人学 2026-01-05 v3

摘要

农业机器人正在跨越广泛的农业任务,充当强大的助手,但仍严重依赖手动操作或铁轨系统进行移动。AgriVLN 方法和 A2A 基准首次将视觉语言导航(VLN)扩展到农业领域,使机器人能够通过自然语言指令导航至目标位置。不同于人类的双目视觉,大多数农业机器人仅提供单摄像头实现单目视觉,导致空间感知受限。为弥合这一差距,我们提出了一种基于单目深度估计的农业视觉语言导航方法(MDE-AgriVLN),其中提出的 MDE 模块从 RGB 图像生成深度特征,辅助多模态推理。我们在 A2A 基准上评估了 MDE-AgriVLN 方法,成功将成功率提升至 0.32,导航误差降至 4.08 米,展示了农业 VLN 领域的前沿性能。代码:https://github.com/AlexTraveling/MDE-AgriVLN。

关键词

引用

@article{arxiv.2512.03958,
  title  = {MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation},
  author = {Xiaobei Zhao and Xingqi Lyu and Xin Chen and Xiang Li},
  journal= {arXiv preprint arXiv:2512.03958},
  year   = {2026}
}