通过可行动邻域先验提升视觉-语言-动作微调性能
机器人学
2026-04-03 v1
摘要
在实际机器人操作中,状态通常容纳一系列近等价动作。即对于每个状态,都存在一组可行动邻域(Feasible Action Neighborhood, FAN),其中运动会产生 indistinguishable 的进展。然而,现有的视觉-语言-动作(VLA)训练方法直接沿用语言场景的做法,未利用FAN属性,导致泛化能力差和样本效率低。为此,我们引入FAN引导的正则化器,以引导模型输出分布与FAN的几何结构保持一致。具体而言,我们引入高斯先验,鼓励在首选方向和幅度附近实现局部平滑和单峰预测。在大量实验中,包括加强微调(RFT)和监督微调(SFT),我们的方法在样本效率和成功率上均实现了显著提升,涵盖分布内和分布外(OOD)场景。通过与物理操作的内在动作容忍度对齐,FAN引导的正则化提供了一种原则且实用的样本高效、可泛化的VLA适配方法。
引用
@article{arxiv.2604.01570,
title = {Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior},
author = {Haochen Niu and Kanyu Zhang and Shuyu Yin and Qinghai Guo and Peilin Liu and Fei Wen},
journal= {arXiv preprint arXiv:2604.01570},
year = {2026}
}
备注
Accepted by CVPR 2026