中文

GLaD:面向视觉-语言-动作模型的几何潜在蒸馏

机器人学 2025-12-11 v1

摘要

大多数现有视觉-语言-动作 (VLA) 模型主要依赖 RGB 信息,忽略了对于空间推理和操作至关重要的几何线索。在本工作中,我们引入 GLaD,一个在预训练期间通过知识蒸馏纳入 3D 几何先验的几何感知 VLA 框架。我们不仅将几何特征蒸馏到视觉编码器,还将对应的视觉标记的 LLM 隐藏状态与来自冻结几何感知视觉变换器 (VGGT) 的特征对齐,以确保几何理解深入整合到驱动动作预测的多模态表示中。基于该几何蒸馏机制在 Bridge 数据集上预训练的 GLaD,在四个 LIBERO 任务套件上实现 94.1% 的平均成功率,超越使用相同预训练数据的 UniVLA (92.5%)。这些结果验证了几何感知预训练在不要求显式深度传感器或 3D 标注的情况下提升了空间推理和策略泛化。

关键词

引用

@article{arxiv.2512.09619,
  title  = {GLaD: Geometric Latent Distillation for Vision-Language-Action Models},
  author = {Minghao Guo and Meng Cao and Jiachen Tao and Rongtao Xu and Yan Yan and Xiaodan Liang and Ivan Laptev and Xiaojun Chang},
  journal= {arXiv preprint arXiv:2512.09619},
  year   = {2025}
}