中文

关于LoRA微调在工业机器人操作中视觉-语言-动作模型效率的研究

机器人学 2026-07-11 v1 机器学习

摘要

在工业硬件上部署数十亿参数的视觉-语言-动作(VLA)模型需要微调以弥合具身差距。全量微调(FFT)提供了最大的可塑性,但需要数据中心级GPU。我们对π0\pi_0(一种流匹配VLA)的低秩适应(LoRA)进行了系统研究,并在使用UR5e机械臂的四个精密装配任务上进行了评估。在LoRA秩(r=8到256)、分配策略和组件冻结消融的扫描中,我们发现FFT相对于某些LoRA配置没有统计学上的显著优势。性能在r=32时饱和,并且在视觉-语言模型(VLM)主干和动作专家之间均匀分配被证明是足够的。冻结VLM或将视觉编码器限制为LoRA会显著降低性能,表明具身适应需要语义和视觉可塑性。这些结果表明,r=32的LoRA配合完整的视觉编码器微调是一种实用方法,可将静态峰值VRAM从36.2 GiB降至10.8 GiB(参数和优化器状态,不包括激活内存),且没有可检测的性能损失。

关键词

引用

@article{arxiv.2607.10172,
  title  = {On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation},
  author = {Finn Ferchau and Daniel Pommer and Cristian Axenie},
  journal= {arXiv preprint arXiv:2607.10172},
  year   = {2026}
}

备注

12 pages, 5 figures, 3 tables. Accepted at the International Conference on Artificial Neural Networks (ICANN 2026); to appear in Springer LNCS