中文

ReFineVLA:通过教师引导的多模态推理感知通用机器人策略

机器人学 2026-04-21 v1 计算机视觉与模式识别

摘要

视觉语言动作(Vision-Language-Action, VLA)模型因能够将多模态观察与语言指令转化为期望机器人动作而受到广泛关注。尽管取得了进展,VLA模型往往忽略显式推理,仅学习输入-动作的函数映射,忽略了关键逻辑步骤,这在解释性和复杂长期操作任务的泛化方面尤为突出。本文提出了ReFineVLA,一个多模态推理感知的框架,通过教师引导的推理进行微调。我们首先通过专家教师模型生成推理理由来增强机器人数据集,引导VLA模型学习对动作进行推理。随后,我们采用ReFineVLA对预训练VLA模型进行微调,同时保持其基本泛化能力,提升推理能力。我们还通过注意力图可视化分析了ReFineVLA在视觉观察、语言提示与待执行动作之间对齐情况,反映出模型聚焦于相关任务与动作的能力。在一系列模拟操作基准测试中(包括SimplerEnv中的WidowX和Google Robot任务),ReFineVLA实现了最佳性能,在WidowX基准测试和Google机器人任务中均超越第二名方法。

关键词

引用

@article{arxiv.2604.17800,
  title  = {ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning},
  author = {Tuan Van Vo and Tan Q. Nguyen and Khang Nguyen and Nhat Xuan Tran and Duy H. M. Nguyen and An T. Le and Ngo Anh Vien and Minh Nhat Vu},
  journal= {arXiv preprint arXiv:2604.17800},
  year   = {2026}
}

备注

arXiv admin note: substantial text overlap with arXiv:2505.19080