AHA:用于检测和推理机器人操作失败的视觉-语言模型
机器人学
2024-10-02 v1
摘要
开放世界中的机器人操作不仅需要任务执行,还需要检测失败并从中学习的能力。尽管视觉-语言模型(VLM)和大语言模型(LLM)的最新进展提高了机器人的空间推理和问题解决能力,但它们仍然难以进行失败识别,限制了其现实世界的适用性。我们引入了AHA,一个开源的VLM,旨在使用自然语言检测和推理机器人操作中的失败。通过将失败检测构建为一个自由形式的推理任务,AHA能够识别失败并提供跨不同机器人、任务和环境的详细、可调整的解释。我们使用FailGen微调了AHA,FailGen是一个可扩展的框架,生成了第一个大规模的机器人失败轨迹数据集,即AHA数据集。FailGen通过程序化地扰动来自模拟的成功演示来实现这一点。尽管仅在AHA数据集上训练,AHA能有效地泛化到真实世界的失败数据集、机器人系统和未见过的任务。它在多个指标和数据集上比第二好的模型(GPT-4o上下文学习)高出10.3%,并超过六个对比模型(包括五个最先进的VLM)的平均性能35.3%。我们将AHA集成到三个利用LLM/VLM进行强化学习、任务与运动规划以及零样本轨迹生成的操纵框架中。AHA的失败反馈通过细化密集奖励函数、优化任务规划和改进子任务验证来增强这些策略的性能,与GPT-4模型相比,在所有三个任务上平均将任务成功率提高了21.4%。
引用
@article{arxiv.2410.00371,
title = {AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation},
author = {Jiafei Duan and Wilbert Pumacay and Nishanth Kumar and Yi Ru Wang and Shulin Tian and Wentao Yuan and Ranjay Krishna and Dieter Fox and Ajay Mandlekar and Yijie Guo},
journal= {arXiv preprint arXiv:2410.00371},
year = {2024}
}
备注
Appendix and details can be found in project website: https://aha-vlm.github.io/