迈向可及的物理AI:基于LoRA的VLA模型微调用于真实世界机器人控制
机器人学
2025-12-16 v1 人工智能
摘要
视觉-语言-动作(VLA)模型在机器人操作中展现出显著能力,使机器人能够通过来自视觉观测的端到端学习来执行自然语言指令。然而,由于计算约束以及对新机器人形态高效适应的需求,将大规模VLA模型部署在可负担的机器人平台上仍然具有挑战性。本文提出了一种高效的微调方法,并进行了真实世界部署分析,以将VLA模型适配至低成本机器人操作系统。我们提出了一种资源高效的微调策略,利用低秩适配(LoRA)和量化技术,使数十亿参数的VLA模型(3.1B参数)能够在配备8GB显存的消费级GPU上运行。我们的方法解决了将预训练VLA模型适配至新机器人形态的关键挑战,即在有限演示数据下的适应问题,重点关注冻结与解冻视觉编码器之间的权衡。通过在SO101机械臂上进行真实世界部署,完成按钮按压操作任务,我们证明了我们的方法在保持计算效率的同时实现了有效的操作性能。我们提供了对部署挑战、失效模式以及训练数据量与真实世界性能之间关系的详细分析,训练基于200个演示片段。我们的结果表明,通过适当的微调方法,VLA模型可以成功部署在可负担的机器人平台上,使先进操作能力不再局限于昂贵的研究机器人。
引用
@article{arxiv.2512.11921,
title = {Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control},
author = {Abdullah Yahya Abdullah Omaisan and Ibrahim Sheikh Mohamed},
journal= {arXiv preprint arXiv:2512.11921},
year = {2025}
}