中文

VLA 模型的可泛化性比你想象的更强:重新审视物理与空间建模

机器人学 2026-04-01 v2 人工智能 机器学习

摘要

视觉-语言-动作(VLA)模型在分布内表现出强大的性能,但在新相机视角和视觉扰动下性能迅速下降。我们指出,这种脆弱性主要源于空间建模(Spatial Modeling)而非物理建模(Physical Modeling)中的不匹配。为此,我们提出了一种单次适应框架,通过轻量级可学习更新来校准视觉表征。我们首先的方法是特征标记调制(Feature Token Modulation, FTM),它对视觉标记应用全局仿射变换,将 Libero 视角准确率从 48.5% 提升至 87.1%,仅需 4K 参数。建立在此基础上,特征线性适应(Feature Linear Adaptation, FLA)为 ViT 编码器引入低秩更新,在仅 4.7M 参数下实现 90.8% 的成功率——在成本远低于 LoRA 规模微调的情况下,达到相似的性能。这些结果揭示了预训练 VLA 模型中潜在的大量鲁棒性,表明针对性的、最小化的视觉适应足以恢复视角泛化能力。

关键词

引用

@article{arxiv.2512.02902,
  title  = {VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling},
  author = {Weiqi Li and Quande Zhang and Ruifeng Zhai and Liang Lin and Guangrun Wang},
  journal= {arXiv preprint arXiv:2512.02902},
  year   = {2026}
}