基于具象链式思考推理的机器人控制
机器人学
2025-03-10 v3 机器学习
摘要
学习的机器人控制策略的一个关键局限性是其无法泛化到训练数据之外的情形。近期关于视觉语言-动作模型(VLA)的研究表明,使用大型网络预训练视觉语言模型作为学习机器人策略的骨架,可以显著提升其鲁棒性和泛化能力。然而,大型视觉语言模型在其他领域最激动人心的能力之一就是通过迭代推理来解决复杂问题。我们能否将这一能力引入机器人领域,使策略在行动前对给定任务进行推理,从而提升性能?标准 VLA 使用“链式思考”(CoT)风格的提示措施不够有效,因为其可获得的训练示例相对简单。此外,纯粹的语义推理(如常规 CoT 所述)对于需要将推理 grounding 在感官观察和机器人状态上的策略来说不够。为此,我们提出具象链式思考推理(ECoT)用于 VLA,即我们训练 VLA 在预测机器人动作之前,对计划、子任务、运动以及如对象边界框和末端执行器位置等感官特征进行多步推理。我们设计了一个在大型机器人数据集上生成合成训练数据的可扩展管道。我们展示,ECoT 在具有挑战性的泛化任务中使 OpenVLA——当前最强大的开源 VLA 策略的绝对成功率提高了 28%,且无需额外的机器人训练数据。此外,ECoT 使人类更容易解释策略失败的原因,并通过自然语言纠正其行为。
引用
@article{arxiv.2407.08693,
title = {Robotic Control via Embodied Chain-of-Thought Reasoning},
author = {Michał Zawalski and William Chen and Karl Pertsch and Oier Mees and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:2407.08693},
year = {2025}
}
备注
Project Website: https://embodied-cot.github.io. Updated funding information