中文

EveryDayVLA:面向低成本机器人操作的视觉-语言-动作模型

机器人学 2025-11-10 v1 计算机视觉与模式识别

摘要

虽然视觉-语言-动作(VLA)模型将视觉输入和语言指令直接映射到机器人动作,但它们往往依赖高成本硬件且在新颇或杂乱的场景中难以胜任。我们引入 EverydayVLA,一个可组装成本低于 300 美元的 6 自由度操作器,具备有限的有效负载和工作空间。单一的统一模型联合输出离散和连续动作,我们的自适应时域集合监控运动不确定性,以在现场触发重新规划,实现安全可靠的运行。在 LIBERO 上,EveryDayVLA 匹配了最先进的成功率;在实际测试中,它在原分布内和原分布外分别超过了先前方法的 49% 和 34.9%。通过将最先进的 VLA 与成本效益高的硬件相结合,EveryDayVLA democratizes 对基础模型机器人的访问,为在家中和研究实验室的经济实用化铺平了道路。实验视频和细节:https://everydayvla.github.io/

关键词

引用

@article{arxiv.2511.05397,
  title  = {EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation},
  author = {Samarth Chopra and Alex McMoil and Ben Carnovale and Evan Sokolson and Rajkumar Kubendran and Samuel Dickerson},
  journal= {arXiv preprint arXiv:2511.05397},
  year   = {2025}
}

备注

Submitted to ICRA 2026