SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配
计算与语言
2026-02-03 v1
摘要
视觉-语言-动作(VLA)模型在机器人操控中表现出强大的泛化能力,但强化学习(RL)微调常在空间分布迁移下降低鲁棒性。对于基于流匹配的VLA策略,这种降解与稀疏奖励和空间无关探索日益偏向短时序视觉线索有关。为此,我们提出了\textbf{SA-VLA},一个在策略优化期间保持空间 grounding 的空间感知RL适应框架,通过将表示学习、奖励设计和探索与任务几何对齐来实现这一目标。SA-VLA将隐式空间表示与视觉标记融合,提供反映几何进展的稠密奖励,并采用\textbf{SCAN},一种针对流匹配动态的空间条件退火探索策略。 在具有挑战性的多目标和杂乱操控基准测试中,SA-VLA实现了稳定的RL微调,提升了零样本空间泛化,实现更具鲁棒性和可迁移性的行为。代码和项目页面均可在https://xupan.top/Projects/savla访问。
引用
@article{arxiv.2602.00742,
title = {CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs},
author = {Liang Wang and Xinyi Mou and Xiaoyou Liu and Xuanjing Huang and Zhongyu Wei},
journal= {arXiv preprint arXiv:2602.00742},
year = {2026}
}