UP-VLA:面向具身智能体的统一理解与预测模型
计算机视觉与模式识别
2025-06-27 v3 人工智能
摘要
近期在视觉语言动作 (VLA) 模型方面的进展, 利用预训练视觉语言模型 (VLM) 来提高泛化能力. 通常基于视觉语言理解任务进行预训练的 VLM 提供丰富的语义知识和推理能力.然而, 先前的研究表明 VLM 往往关注高层语义内容, 忽略低层特征, 限制了其捕捉详细空间信息和理解物理动态的能力.这些方面对于具身控制任务至关重要, 但在现有预训练范式中仍未得到充分探索.本文调查了 VLA 的训练范式, 并引入 **UP-VLA**, 一种 **统一** VLA 模型训练, 同时包含多模态 **理解** 与未来 **预测** 目标, 以增强高层语义理解和低层空间理解.实验结果表明, UP-VLA 在 Calvin ABC-D 基准上相较于前沿方法实现了 33% 的改进.此外, UP-VLA 在实际操作任务中表现出更高的成功率, 尤其是那些需要精确空间信息的任务.
引用
@article{arxiv.2501.18867,
title = {UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent},
author = {Jianke Zhang and Yanjiang Guo and Yucheng Hu and Xiaoyu Chen and Xiang Zhu and Jianyu Chen},
journal= {arXiv preprint arXiv:2501.18867},
year = {2025}
}
备注
Accepted to ICML2025