Shake-VLA:基于视觉-语言-动作模型的双手机器人操作与液体混合系统
机器人学
2025-01-14 v1
摘要
本文介绍了 Shake-VLA,这是一个基于视觉-语言-动作(VLA)模型的系统,旨在实现双手机器人操作,用于自动调酒。系统集成了用于检测酒瓶和读取标签的视觉模块、用于解释用户指令的语音识别模块,以及用于生成任务特定机器人指令的语言模型。采用力扭矩(FT)传感器精确测量液体倒出量,确保调制过程中的配料比例准确。系统架构包括用于访问和调整食谱的检索增强生成(RAG)模块、用于解决原料可用性问题的异常检测机制,以及用于灵巧操作的双臂机器人。实验评估显示,系统各组件均取得了高成功率,其中语音识别模块在嘈杂环境下达到 93% 的成功率,视觉模块在杂乱环境中实现了 91% 的目标和标签检测成功率,异常检测模块成功识别了 95% 的原料与食谱需求之间的差异,系统在从食谱制定到动作生成的整个调酒过程中实现了 100% 的成功率。
关键词
引用
@article{arxiv.2501.06919,
title = {Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing},
author = {Muhamamd Haris Khan and Selamawit Asfaw and Dmitrii Iarchuk and Miguel Altamirano Cabrera and Luis Moreno and Issatay Tokmurziyev and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2501.06919},
year = {2025}
}
备注
Accepted to IEEE/ACM HRI 2025