HumanoidVLM:面向富接触人形操作的视觉-语言导引阻抗控制
机器人学
2026-01-22 v1
摘要
人形机器人必须使其接触行为适应不同的物体和任务,然而大多数控制器依赖于固定的、手动调谐的阻抗增益和夹爪设置。本文介绍了 HumanoidVLM,这是一个视觉-语言驱动的检索框架,使 Unitree G1 人形机器人能够直接从以自我为中心的 RGB 图像中选择适合任务的笛卡尔阻抗参数和夹爪配置。该系统将用于语义任务推断的视觉-语言模型与基于 FAISS 的检索增强生成(RAG)模块相耦合,该模块从两个自定义数据库中检索经过实验验证的刚度-阻尼对和特定于物体的抓取角度,并通过任务空间阻抗控制器执行它们以实现柔顺操作。我们在 14 个视觉场景中对 HumanoidVLM 进行了评估,实现了 93% 的检索准确率。真实世界实验显示出稳定的交互动力学,z 轴跟踪误差通常在 1-3.5 cm 以内,且虚拟力与依赖于任务的阻抗设置保持一致。这些结果证明了将语义感知与基于检索的控制相联系的可行性,作为迈向自适应人形操作的一条可解释路径。
引用
@article{arxiv.2601.14874,
title = {HumanoidVLM: Vision-Language-Guided Impedance Control for Contact-Rich Humanoid Manipulation},
author = {Yara Mahmoud and Yasheerah Yaqoot and Miguel Altamirano Cabrera and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2601.14874},
year = {2026}
}
备注
This paper has been accepted for publication at LBR of HRI 2026 conference