LocoVLM:面向适配多样化四足 locomotion 策略的视觉语言 grounding
机器人学
2026-02-12 v1
摘要
尽管近期在四足 locomotion 学习方面取得了进展,但仍主要依赖于环境的几何表示,限制了机器人应对高层次语义(如人类指令)的能力。为此,我们提出一种新方法,将基础模型中的高层次常识推理集成到四足 locomotion 适应过程中。具体而言,我们的方法利用预训练的大语言模型为四足机器人定制化指令导向技能数据库。采用预训练的视觉语言模型提取高层次环境语义,并将其在技能数据库中进行 grounding,使机器人能够获得实时的技能建议。为实现灵活的技能控制,我们训练了一个风格条件化策略,能够生成与指定风格高度一致的多样且稳健的 locomotion 技能。迄今为止,已有工作首次展示了无需在云端基础模型上在线查询的情况下,利用环境语义和指令进行四足 locomotion 实时适应,指令遵循准确率可达 87%。
关键词
引用
@article{arxiv.2602.10399,
title = {LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies},
author = {I Made Aswin Nahrendra and Seunghyun Lee and Dongkyu Lee and Hyun Myung},
journal= {arXiv preprint arXiv:2602.10399},
year = {2026}
}
备注
Project page: https://locovlm.github.io