中文

桥接VLM与KMP: 通过语义关键点表示实现细粒度机器人操控

机器人学 2025-03-05 v1

摘要

从早期的运动原语(MP)技术到现代的视觉语言模型(VLM),自主操控一直是机器人领域的关键议题。作为两种极端方法,VLM-based方法强调零-shot和自适应操控,但在细粒度规划方面受限。相比,MP-based方法在精确轨迹泛化方面卓越,但缺乏决策能力。为利用两种框架的优势,我们提出VL-MP,将VLM与Kernelized Movement Primitives(KMP)通过低失真决策信息传递桥接集成,实现在模糊情境下的细粒度机器人操控。VL-MP的关键在于通过语义关键点约束准确表示任务决策参数,从而实现更精确的任务参数生成。此外,我们引入局部轨迹特征增强的KMP以支持VL-MP,实现复杂轨迹的形状保持。在复杂真实环境中进行的广泛实验表明,VL-MP有效实现了自适应和细粒度操控。

关键词

引用

@article{arxiv.2503.02748,
  title  = {Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation},
  author = {Junjie Zhu and Huayu Liu and Jin Wang and Bangrong Wen and Kaixiang Huang and Xiaofei Li and Haiyun Zhan and Guodong Lu},
  journal= {arXiv preprint arXiv:2503.02748},
  year   = {2025}
}