肯定男性综合症:为具身机器人智能体测试戒绝能力
机器人学
2026-05-21 v1 计算机视觉与模式识别
摘要
视觉语言模型(VLMs)用作具身智能体的高层规划器,将自然语言指令和视觉观察转化为动作计划。尽管已有工作研究了 LLM 中的戒绝问题,但现有基准大多为文本单一,未捕捉具身机器人环境所特有的感知 grounding 与物理约束。在此类设置下,戒绝需要识别指令模糊、不可行、基于错误前提,或因可用感知模态和上下文而无法解决的情形。为填补这一空白,我们引入一种分类框架,概括描述具身机器人情境下的戒绝,并提出 RoboAbstention,一个面向具身机器人生成可验证戒绝指令的可扩展且可审计的框架。RoboAbstention 通过三阶段管道实现该分类:(1)结构化视觉 grounding,(2)确定性约束推导,(3)通过类别特定模板的受控指令生成。这使得构建具有可验证戒绝条件的多样化数据集成为可能。我们评估了多款前沿 VLMs,发现所有模型在戒绝方面都表现显著不足,包括那些具备高级推理能力的模型。表现最佳的模型 Gemini 2.5 Flash 仅对 6,069 条基准指令中的 39.0% 进行戒绝,而具身规划器 Gemini Robotics ER 1.6 Preview 仅对 16.5% 进行戒绝。我们进一步探讨了改善 VLM 规划器戒绝的方法,如防御性提示和情境学习,发现这些干预显著提升性能,Gemini Robotics ER 1.6 Preview 达到 93.6% 的戒绝率,GPT 5.4 Mini 达到 88.6%,但仍不存在完全解决问题的方法。我们将 OpenSource RoboAbstention,网址为 https://purseclab.github.io/RoboAbstention/。
引用
@article{arxiv.2605.20544,
title = {The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents},
author = {Doguhan Yeke and Elif Su Temirel and Ananth Shreekumar and Brandon Lee and Dongyan Xu and Z Berkay Celik},
journal= {arXiv preprint arXiv:2605.20544},
year = {2026}
}