中文

CAST:反事实标签提升视觉语言动作模型中的指令遵循能力

机器人学 2025-08-20 v1

摘要

通用机器人应能够理解并遵循用户指令,但当前的视觉语言动作(VLA)模型在遵循细粒度命令方面存在挑战,尽管它们提供了将开放词汇自然语言指令映射到机器人动作的强大架构。一个原因是现有机器人数据集中缺乏语义多样性和语言 grounding,具体而言,是缺乏针对相似观察的细粒度任务多样性。为此,我们提出了一种新方法,通过利用视觉语言模型生成反事实标签来扩充现有机器人数据集。我们的方法通过生成反事实语言和动作来增加机器人数据集的语言 grounding 的多样性和细粒度,从而提升VLA的语言遵循能力。我们评估了所得模型遵循语言指令的能力,涵盖从简单的对象中心命令到复杂的指代任务,通过在3个不同的室内和户外环境中进行视觉语言导航实验。我们的实验表明,反事实重新标记(无需额外的数据收集)显著提升了VLA策略的指令遵循能力,使其与最先进的方法相竞争,并在导航任务中将成功率提高27%。

关键词

引用

@article{arxiv.2508.13446,
  title  = {CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models},
  author = {Catherine Glossop and William Chen and Arjun Bhorkar and Dhruv Shah and Sergey Levine},
  journal= {arXiv preprint arXiv:2508.13446},
  year   = {2025}
}