中文

Bi-VLA:基于双边控制的模仿学习与视觉-语言融合的动作生成

机器人学 2025-09-24 v1 机器学习

摘要

我们提出了基于双边控制的模仿学习与视觉-语言融合的动作生成(Bi-VLA),这是一种新颖的框架,将基于双边控制的模仿学习扩展为在单一模型内处理多个任务。传统的双边控制方法利用关节角度、速度、力矩和视觉进行精确操作,但需要针对特定任务的模型,限制了其通用性。Bi-VLA 通过利用来自主从双边控制的机器人关节角度、速度和力矩数据,并结合通过 SigLIP 和基于 FiLM 的融合提取的视觉特征与自然语言指令,克服了这一局限性。我们在两种任务类型上验证了 Bi-VLA:一种需要补充语言线索,另一种仅靠视觉即可区分。真实机器人实验表明,与传统的基于双边控制的模仿学习相比,Bi-VLA 能够成功解析视觉-语言组合并提高任务成功率。我们的 Bi-VLA 解决了先前双边方法的单任务限制,并提供了经验证据表明结合视觉与语言显著增强了通用性。实验结果验证了 Bi-VLA 在真实世界任务中的有效性。更多材料请访问网站:https://mertcookimg.github.io/bi-vla/

关键词

引用

@article{arxiv.2509.18865,
  title  = {Bi-VLA: Bilateral Control-Based Imitation Learning via Vision-Language Fusion for Action Generation},
  author = {Masato Kobayashi and Thanpimon Buamanee},
  journal= {arXiv preprint arXiv:2509.18865},
  year   = {2025}
}