VLA-OPD:通过基于策略的蒸馏桥接离线SFT与在线RL,用于视觉语言动作模型
机器人学
2026-03-30 v1
摘要
虽然预训练的视觉语言动作(VLA)模型在机器人操作中展现出惊人的泛化能力,但后训练仍是确保部署期间可靠性能的关键。然而,标准的离线监督微调(SFT)受分布迁移和预训练能力 catastrophic forgetting(灾难性遗忘)的影响,而在线强化学习(RL)则在稀疏奖励和样本效率方面受限。本文提出了基于策略的VLA蒸馏(VLA-OPD),一种桥接SFT效率与RL鲁棒性的框架。不依赖稀疏环境奖励,VLA-OPD利用专家教师为学生自生成轨迹提供稠密、token级监督,从而在策略诱导的状态上实现主动错误纠正,同时通过温和对齐保留预训练的通用能力。关键在于,我们通过Reverse-KL目标函数构建VLA-OPD。不同于导致模式覆盖熵爆炸的标准Forward-KL,或引起早期熵坍缩的Hard-CE,本文的受限模式寻求目标确保通过过滤教师的贝叶斯不确定性来维持动作多样性,从而实现稳定的策略学习。在LIBERO和RoboTwin2.0基准实验中,VLA-OPD显著提升了相较于RL的样本效率和相较于SFT的鲁棒性,有效缓解了后训练中的灾难性遗忘。
引用
@article{arxiv.2603.26666,
title = {VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation},
author = {Zhide Zhong and Haodong Yan and Junfeng Li and Junjie He and Tianran Zhang and Haoang Li},
journal= {arXiv preprint arXiv:2603.26666},
year = {2026}
}