DualVLA:通过部分解耦推理与动作构建通用具身智能体
计算机视觉与模式识别
2025-12-01 v1 机器人学
摘要
构建具备强大推理能力的通用视觉语言动作(VLA)模型,常用策略是先在机器人演示数据上训练专家 VLA 以获取可靠的操控技能,然后结合混合标注机器人数据和多模态数据以恢复更广泛的推理能力。然而,我们观察到这样得到的推理 VLA 在微调前常出现动作性能下降,呈现我们称之为 action degeneration 的现象。为此,我们提出 DualVLA,通过精心设计的后训练提升动作性能,同时保持推理能力。我们首先引入双层数据剪枝方法,移除冗余的具身推理,防止其对动作学习产生负面影响。进一步设计双教师自适应蒸馏策略,为不同数据域分配不同的监督信号,同时维持推理能力。为弥合通用 VLA 评估的空白,我们还提出 VLA Score,将 VLA 能力解耦为推理、意图、动作和对齐四个维度,以实现更细粒度的评估。实验表明,DualVLA 在 SimplerEnv 中的平均成功率为 61.0,跨八个竞争性多模态基准的平均得分为 65.4,展示了在精确动作执行与多模态理解之间取得更佳平衡。项目网站: https://costaliya.github.io/DualVLA/。
引用
@article{arxiv.2511.22134,
title = {DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action},
author = {Zhen Fang and Zhuoyang Liu and Jiaming Liu and Hao Chen and Yu Zeng and Shiting Huang and Zehui Chen and Lin Chen and Shanghang Zhang and Feng Zhao},
journal= {arXiv preprint arXiv:2511.22134},
year = {2025}
}