评估步骤,而非仅评估目标:基于视觉语言模型的机器人操作子目标评估
人工智能
2025-09-25 v1 机器人学
摘要
机器人学习论文通常只报告单一的二元成功率(SR),这掩盖了策略在多步骤操作任务中成功或失败的具体环节。我们认为,子目标级别的报告应成为常规做法:对于每条轨迹,提供一个每个子目标的成功率向量,使部分能力(例如,抓取与倾倒)变得可见。我们为StepEval提出了一个蓝图,这是一个成本感知的即插即用评估框架,利用视觉语言模型(VLM)作为自动裁判,根据记录的图像或视频判断子目标的结果。我们的贡献并非提出新的基准或API,而是为一个可扩展的、社区驱动的开源项目勾勒设计原则。在StepEval中,策略评估的主要产物是每个子目标的成功率向量;然而,当有真实的子目标成功标签可用时,其他量(例如,延迟或成本估计)也会被考虑用于框架优化诊断,以帮助社区调整评估效率和准确性。我们讨论了这样一个框架如何保持模型无关性、支持单视图或多视图输入,并且足够轻量级以便在各实验室采用。预期的贡献是一个共享的方向:一个最小化、可扩展的种子项目,邀请开源贡献,从而使“评估步骤,而非仅评估最终目标”成为一种标准且可复现的实践。
引用
@article{arxiv.2509.19524,
title = {Score the Steps, Not Just the Goal: VLM-Based Subgoal Evaluation for Robotic Manipulation},
author = {Ramy ElMallah and Krish Chhajer and Chi-Guhn Lee},
journal= {arXiv preprint arXiv:2509.19524},
year = {2025}
}
备注
Accepted to the CoRL 2025 Eval&Deploy Workshop