通过合成指令增强提升VLA模型语言泛化能力:基于OpenVLA的参数高效微调
人工智能
2026-03-18 v1
摘要
泛化是具身智能的核心挑战,因为机器人必须适应多样化的环境。虽然OpenVLA代表了视觉-语言-动作模型的最新进展(SOTA),通过大规模预训练实现,但其在遇到完全新的环境时的零样性能仍有限。本文提出了一种参数高效的微调策略,通过合成指令集增强OpenVLA的语言泛化能力。该论文利用大型语言模型(LLM)生成丰富的语义等价但结构多样化的命令,用于现有轨迹。在本实验中,采用低秩适应(LoRA)对OpenVLA进行微调,以增强模型在复杂自然语言意图与机器人动作之间的桥接能力。结果表明,经过LoRA增强的模型在鲁棒性方面具有优势,表明丰富化专业数据集的语言空间对具身智能体至关重要。
引用
@article{arxiv.2603.16044,
title = {Enhancing Linguistic Generalization of VLA: Fine-Tuning OpenVLA via Synthetic Instruction Augmentation},
author = {Dongik Shin},
journal= {arXiv preprint arXiv:2603.16044},
year = {2026}
}