LOVON:足态开词表对象导航器
机器人学
2025-07-10 v1 计算机视觉与模式识别
摘要
在开放世界环境中执行对象导航始终是一个棘手且普遍存在的挑战,这对于机器人系统而言尤为如此,尤其是当需要同时进行开放世界对象检测和高层任务规划时。传统方法往往难以有效地集成这些组件,这限制了其处理复杂、长程导航任务的能力。在本文中,我们提出了 LOVON,一种新型框架,将大型语言模型(LLM)用于分层任务规划,与开放词表视觉检测模型相结合,专为有效的长程对象导航而设计,适用于动态、非结构化环境。在面对包括视觉抖动、盲区和临时目标丢失在内的现实挑战时,我们设计了专门解决方案,例如用于视觉稳定的拉普拉斯方差滤波。我们还开发了一种功能执行逻辑,确保 LOVON 在自主导航、任务适应和稳健任务完成方面的能力。广泛的评估表明,成功完成了涉及实时检测、搜索和导航至开放词表动态目标的长序列任务。此外,跨不同足态机器人(Unitree Go2、B2 和 H1-2)的实际实验展示了 LOVON 的兼容性及其便利的即插即用特性。
引用
@article{arxiv.2507.06747,
title = {LOVON: Legged Open-Vocabulary Object Navigator},
author = {Daojie Peng and Jiahang Cao and Qiang Zhang and Jun Ma},
journal= {arXiv preprint arXiv:2507.06747},
year = {2025}
}
备注
9 pages, 10 figures; Project Page: https://daojiepeng.github.io/LOVON/