先验视觉语言嵌入能否唯一指导机器人导航?
机器人学
2025-06-18 v1
摘要
基础模型通过为机器人提供无需任务特定训练的丰富语义表示而彻底变革了机器人学。虽然许多方法将预训练的视觉语言模型(VLMs)与专门的导航架构集成,但一个根本性问题仍悬置:在无需额外微调或专用模块的情况下,这些预训练嵌入能否成功指导导航?我们提出一种极简框架,通过在冻结的视觉语言嵌入上训练行为克隆政策来分离这一问题。我们的做法在语言指定目标导航方面实现了 74% 的成功率,仅次于 100% 的感知专家,尽管平均需要 3.2 倍的步骤。这一绩效差距表明,预训练嵌入有效支持基本的语言 grounding,但在长期计划和空间推理方面存在挑战。通过提供这个实证基线,我们既突显了使用基础模型作为具身任务的即插即用表示的能力,也揭示了其局限性,为面对资源受限场景下系统复杂度与性能之间权衡的机器人研究人员提供了关键见解。我们的代码已公开于 https://github.com/oadamharoon/text2nav。
引用
@article{arxiv.2506.14507,
title = {Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?},
author = {Nitesh Subedi and Adam Haroon and Shreyan Ganguly and Samuel T. K. Tetteh and Prajwal Koirala and Cody Fleming and Soumik Sarkar},
journal= {arXiv preprint arXiv:2506.14507},
year = {2025}
}
备注
6 figures, 2 tables, Accepted to Robotics: Science and Systems (RSS) 2025 Workshop on Robot Planning in the Era of Foundation Models (FM4RoboPlan)