使用 LLM 的烹饪任务规划与图网络验证
机器人学
2025-03-28 v1
摘要
由于其复杂性,烹饪任务仍然是机器人学中的一个挑战性问题。人们烹饪的视频是此类任务的宝贵信息来源,但在如何将这些数据转换到机器人环境方面引入了很大的可变性。本研究旨在通过使用基于大型语言模型 (LLM) 的任务与运动规划 (TAMP) 框架,自主从带字幕的视频中生成烹饪任务计划并执行它们,从而简化这一过程,重点是任务计划生成步骤。由于视频中的不确定性及其输出中产生幻觉的风险,传统的基于 LLM 的任务规划方法并不适合解释烹饪视频数据。为了解决这两个问题,我们探索将 LLM 与功能面向对象网络 (FOON) 相结合,以验证计划并在失败时提供反馈。这种组合能够生成在逻辑上正确且可由机器人执行的带有操作运动的任务序列。我们将我们的方法针对双臂机器人设置生成的 5 个烹饪食谱的计划执行情况,与仅使用少样本 LLM 方法生成的计划进行了比较。它成功执行了我们方法生成的 4 个计划,而仅使用 LLM 生成的计划中只有 1 个能够被执行。
引用
@article{arxiv.2503.21564,
title = {Cooking Task Planning using LLM and Verified by Graph Network},
author = {Ryunosuke Takebayashi and Vitor Hideyo Isume and Takuya Kiyokawa and Weiwei Wan and Kensuke Harada},
journal= {arXiv preprint arXiv:2503.21564},
year = {2025}
}