ConsisVLA-4D:提升3D感知与4D推理在机器人操控中的时空一致性
机器人学
2026-05-07 v1
摘要
当前视觉语言动作(VLA)模型主要聚焦于将2D观测映射到动作,但在时空感知与推理方面存在显著局限:1)空间表示常依赖额外传感器,导致计算开销显著增加;2)视觉推理通常仅限于未来帧预测,缺乏与指令导向场景的对齐,从而妨碍时空一致性。为此,我们提出ConsisVLA-4D,一个统一且高效的框架,增强3D感知与4D推理中的时空一致性。具体设计:1)CV-Aligner通过过滤指令相关区域并跨多个视角对齐物体身份,确保跨视图物体语义一致性;2)CO-Fuser通过紧凑的潜在表示消除视角间物体空间关系歧义,保证跨物体空间几何一致性。基于上述组件,我们引入3)CS-Thinker以实现跨场景时空一致性。它从CV-Aligner的物体语义标记中学习局部动态知识,从CO-Fuser的几何标记中获取全局深度,从而增强场景变化下的高效视觉推理。广泛实验表明,凭借其高效时空一致性设计,ConsisVLA-4D在LIBERO基准和真实平台上分别实现了21.6%和41.5%的性能提升,推理速度分别提升了2.3倍和2.4倍。ConsisVLA-4D已开源公开。
引用
@article{arxiv.2605.05126,
title = {ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation},
author = {Wei Li and Jizhihui Liu and Li Yixing and Junwen Tong and Rui Shao and Liqiang Nie},
journal= {arXiv preprint arXiv:2605.05126},
year = {2026}
}
备注
Accepted to CVPR 2026, Project Page: https://github.com/iLearn-Lab/CVPR26-ConsisVLA-4D