AgriVLN:面向农业机器人的视觉与语言导航
机器人学
2025-08-12 v1 人工智能
计算机视觉与模式识别
摘要
农业机器人已成为农业任务中的强大力量,然而,它们仍然严重依赖人工操作或不可移动的轨道进行移动,导致机动性有限和适应性差。视觉与语言导航(VLN)使机器人能够遵循自然语言指令导航到目标目的地,在多个领域展现出强大性能。然而,现有的基准或方法均非专门针对农业场景设计。为弥补这一空白,我们提出了“农业到农业”(A2A)基准,包含跨越六个不同农业场景的1,560个片段,其中所有真实的RGB视频均由四足机器人上高度为0.38米的前置摄像头拍摄,符合实际部署条件。同时,我们提出了基于视觉语言模型(VLM)的面向农业机器人的视觉与语言导航(AgriVLN)基线,该模型通过精心设计的模板进行提示,能够理解给定指令和农业环境,从而生成用于机器人控制的适当低级动作。在A2A上评估时,AgriVLN在短指令上表现良好,但在长指令上表现不佳,因为它常常无法跟踪当前正在执行指令的哪一部分。为解决此问题,我们进一步提出了子任务列表(STL)指令分解模块,并将其集成到AgriVLN中,将成功率(SR)从0.33提高到0.47。我们还将AgriVLN与几种现有的VLN方法进行了比较,展示了其在农业领域的先进性能。
引用
@article{arxiv.2508.07406,
title = {AgriVLN: Vision-and-Language Navigation for Agricultural Robots},
author = {Xiaobei Zhao and Xingqi Lyu and Xiang Li},
journal= {arXiv preprint arXiv:2508.07406},
year = {2025}
}