中文

做什么?教导视觉-语言-动作模型拒绝不可能的任务

人工智能 2025-08-25 v1 机器人学

摘要

最近,视觉-语言-动作 (VLA) 模型在一系列机器人任务上展示了强大的性能。这些模型依赖多模态输入,其中语言指令发挥着关键作用——不仅在预测动作方面,而且在鲁棒地解释用户意图方面,即使请求无法实现。在本工作中,我们研究了 VLA 如何识别、解释和响应错误前提指令:引用环境中不存在的对象或条件的自然语言命令。我们提出了 Instruct-Verify-and-Act (IVA),一个统一框架,(i) 检测因错误前提而无法执行的指令,(ii) 进行基于语言的澄清或纠正,以及 (iii) 在感知和动作中锚定合理的替代方案。为此,我们构建了一个具有结构化语言提示的大规模指令微调设置,并训练了一个能够处理准确和错误请求的 VLA 模型。我们的方法利用了一个上下文增强的、半合成的数据集,其中包含配对的正面和错误前提指令,从而实现鲁棒的检测和自然语言纠正。我们的实验表明,IVA 相比基线将错误前提检测准确率提高了 97.56%,同时在错误前提场景中的成功响应率提高了 50.78%。

关键词

引用

@article{arxiv.2508.16292,
  title  = {Do What? Teaching Vision-Language-Action Models to Reject the Impossible},
  author = {Wen-Han Hsieh and Elvis Hsieh and Dantong Niu and Trevor Darrell and Roei Herzig and David M. Chan},
  journal= {arXiv preprint arXiv:2508.16292},
  year   = {2025}
}

备注

9 pages, 2 figures, 1 table