$\pi$-StepNFT:在基于流的视觉语言动作模型中,更宽的探索空间需要更细粒度的步骤
机器人学
2026-03-10 v2 计算机视觉与模式识别
摘要
基于流的视觉语言-动作 (VLA) 模型在具身控制方面表现出色,但在多步采样过程中因难以计算的似然值而受限,阻碍了在线强化学习。我们提出了 \textbf{\textit{\boldsymbol{\pi-StepNFT}}}(Step-wise Negative-aware Fine-Tuning),这是一种无需辅助价值网络、仅需单次前向传播即可完成优化的批评家与似然值-free 框架。我们指出,更宽的探索空间需要更细粒度、逐步的引导以实现对齐。经验上,-StepNFT 在 LIBERO 上解锁了潜在潜力,实现了具竞争力的few-shot鲁棒性。此外,它在 ManiSkill 上实现了优于基于价值的基线的泛化,在 OOD 场景中表现更好,通过防止对多模态特征的过拟合实现。这一特性为复杂真实世界应用提供了可扩展的解决方案。
关键词
引用
@article{arxiv.2603.02083,
title = {$\pi$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs},
author = {Siting Wang and Xiaofeng Wang and Zheng Zhu and Minnan Pei and Xinyu Cui and Cheng Deng and Jian Zhao and Guan Huang and Haifeng Zhang and Jun Wang},
journal= {arXiv preprint arXiv:2603.02083},
year = {2026}
}