MDE-AgriVLN:基于单目深度估计的农业视觉语言导航
机器人学
2026-01-05 v3
摘要
农业机器人正在跨越广泛的农业任务,充当强大的助手,但仍严重依赖手动操作或铁轨系统进行移动。AgriVLN 方法和 A2A 基准首次将视觉语言导航(VLN)扩展到农业领域,使机器人能够通过自然语言指令导航至目标位置。不同于人类的双目视觉,大多数农业机器人仅提供单摄像头实现单目视觉,导致空间感知受限。为弥合这一差距,我们提出了一种基于单目深度估计的农业视觉语言导航方法(MDE-AgriVLN),其中提出的 MDE 模块从 RGB 图像生成深度特征,辅助多模态推理。我们在 A2A 基准上评估了 MDE-AgriVLN 方法,成功将成功率提升至 0.32,导航误差降至 4.08 米,展示了农业 VLN 领域的前沿性能。代码:https://github.com/AlexTraveling/MDE-AgriVLN。
引用
@article{arxiv.2512.03958,
title = {MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation},
author = {Xiaobei Zhao and Xingqi Lyu and Xin Chen and Xiang Li},
journal= {arXiv preprint arXiv:2512.03958},
year = {2026}
}